사실관계
스캐터랩은 이용자가 올린 카카오톡 대화를 분석해 연애 조언을 제공하는 ‘연애의 과학’과 ‘텍스트앳’ 앱을 운영했다. 회사는 2020년 2월부터 2021년 1월까지 두 앱에서 수집한 약 60만 명의 카카오톡 대화 문장 약 94억 건을 페이스북 이용자 대상 챗봇 ‘이루다’의 개발과 운영에 이용했다. 대화에 포함된 이름, 휴대전화번호, 주소 등은 삭제나 암호화 없이 그대로 쓰였다. 회사는 또 2019년 10월부터 2021년 1월까지 이름과 지역 정보가 담긴 대화 문장 1,431건을 인공지능 모델과 함께 깃허브에 게시했다. 조사 과정에서 14세 미만 아동의 개인정보를 법정대리인 동의 없이 수집한 사실도 드러났다.
쟁점
핵심 쟁점은 특정 서비스를 위해 수집한 대화를 이용자에게 알리거나 새로 동의를 받지 않고 다른 인공지능 서비스 개발에 쓸 수 있는지였다. 위원회는 이와 함께 식별정보를 지우지 않은 채 대화를 처리한 것이 개인정보 보호법의 가명정보 규정에 부합하는지, 모델과 예시 문장을 공개 저장소에 올린 행위가 적법한지, 14세 미만 아동의 개인정보를 처리하면서 법정대리인 동의 의무를 지켰는지도 살폈다. 챗봇 학습데이터가 개인정보 보호법에 따라 심사된 초기 사례라는 점에서도 주목을 받았다.
판단
개인정보보호위원회는 2021년 4월 28일 전체회의에서 개인정보 보호법 위반 8건을 인정하고, 스캐터랩에 과징금 5,550만 원과 과태료 4,780만 원 등 총 1억 330만 원을 부과하는 한편 시정조치를 명했다. 위원회는 카카오톡 대화가 수집 목적 밖에서 이용되었고, 이용자에게 그 사실이 충분히 고지되지 않았다고 판단했다. 깃허브에 게시된 문장에는 특정 개인을 알아볼 수 있는 정보가 들어 있어 가명정보 처리 규정에도 어긋난다고 보았다. 윤종인 위원장은 이번 처분으로 특정 서비스에서 수집한 정보를 다른 서비스에 무분별하게 이용할 수 없다는 점이 분명해졌다고 밝혔다.
의의
이 결정은 정부가 인공지능 기업의 무분별한 개인정보 처리를 제재한 첫 사례로 꼽힌다. 챗봇 학습에 쓰인 대화 데이터에도 목적 제한, 투명성, 가명처리 규정이 그대로 적용된다는 점을 구체적 사실관계를 통해 보여 주었다. 학습데이터의 출처와 이용자에 대한 고지 범위가 인공지능 개발 과정에서 법적으로 따져야 할 문제로 자리 잡는 계기가 되었다.
관련 절차
이용자들이 스캐터랩을 상대로 낸 손해배상 소송에서 서울동부지방법원은 2025년 일부 원고에게 위자료 지급을 명했고, 회사는 항소했다.