청소년 이용자가 38만 명에 이르는 AI 캐릭터 챗봇 '제타(zeta)'가 성인인증을 거치지 않은 상태에서 미성년자로 설정된 캐릭터를 대상으로 성폭력 등을 묘사하는 대화를 생성한 것으로 확인됐다.
유해 대화가 차단되자 AI가 차단을 피할 수 있는 표현 방식을 제시하기도 했다. 운영사 스캐터랩은 탐지 기준 강화 등 긴급 조치에 나섰다.
국회 과학기술정보방송통신위원회 황정아 의원(더불어민주당, 대전 유성을)이 스캐터랩에서 받은 자료에 따르면 지난달 말 기준 제타의 월간 활성 이용자는 148만 명이다. 이 가운데 19세 이하가 38만 명으로 25.7%를 차지한다.
황 의원실은 성인인증을 하지 않은 계정으로 청소년 이용자와 같은 안전 기준이 적용되는 '세이프 모드'에서 제타를 점검했다.
그 결과 미성년 캐릭터가 등장하는 2개 대화 시나리오에서 성폭력과 성착취, 이를 빌미로 한 협박이 이어지는 대화가 생성됐다.
제타의 유해 대화 탐지 모델은 점검 과정에서 문제 발화 200여 건을 차단했다.
하지만 표현을 바꿔 가며 반복적으로 시도하자 일부 안전장치가 무력화되면서 차단돼야 할 발화가 생성·노출됐다.
대화가 차단된 뒤에는 AI가 필터를 피할 수 있는 표현 방식을 제시하고 유해한 전개를 이어가기도 했다.
황 의원실은 악용을 막기 위해 구체적인 우회 방법은 공개하지 않기로 했다.
스캐터랩이 의원실에 제출한 경위서에 따르면 제타는 이야기를 만드는 '플레이 모델'과 그 결과를 따로 검사해 부적절한 대화를 차단하는 '어뷰징 탐지 모델'로 구성된다.
회사는 문제의 원인으로 두 가지를 들었다. 정상적인 창작 표현이 지나치게 차단되지 않도록 탐지 기준을 다소 느슨하게 설정했고 탐지 모델이 AI의 응답을 개별 단위로 판정해 대화 전체의 맥락을 충분히 반영하지 못했다는 것이다.
AI가 제시한 차단 회피 표현에 대해서는 이용자 요청에 맞춰 생성된 허구의 서술이었지만 우회 요청에 응답한 것 자체가 개선이 필요한 문제라고 밝혔다.
스캐터랩은 문제를 확인한 직후 두 가지 긴급 조치에 착수했다.
하나는 세이프 모드 이용자 전체를 대상으로 탐지 기준을 강화해 직접적인 묘사뿐 아니라 간접적·은유적 표현도 걸러내도록 한 것이다.
강화된 기준으로 의원실의 점검 대화를 다시 검사한 결과 차단되는 문제 발화가 200여 건에서 400여 건으로 늘었다.
다른 하나는 같은 대화 시나리오에서 차단이 반복되면 '경고→대화 정지→대화 초기화' 순으로 제재하는 단계별 제재다.
판정 오류를 신고할 수 있는 기능도 함께 제공한다.
두 조치는 지난 10일 적용 대상 이용자의 5~10%부터 시작해 단계적으로 넓히고 있으며 오는 18일까지 전체 적용을 마칠 계획이다.
근본 대책으로는 안전 통제의 중심을 별도 탐지 모델에서 이야기를 만드는 AI 자체로 옮기겠다고 밝혔다.
올해 4분기 중 AI가 생성 단계부터 이용자 연령에 맞게 전개와 묘사 수위를 조절하고 차단 우회 요청에는 응하지 않도록 학습시킬 계획이다.
대화 전체 맥락을 반영하는 새 탐지 모델도 배포하고 기존 탐지 모델은 2차 안전장치로 유지한다.
청소년 보호 장치도 추가한다. 청소년 이용자의 기본 이용시간을 하루 3시간, 기본 결제 한도를 월 10만 원으로 정하고 대화 콘텐츠를 2~3단계 연령등급으로 나눠 등급에 맞지 않는 이용자는 이용을 제한한다.
매월 정기적으로 공격 시나리오를 대입해 취약점을 찾는 레드팀 점검도 하기로 했다.
스캐터랩은 "성인인증 없이 이용할 수 있는 환경에서 유해한 대화가 생성된 문제를 무겁게 받아들인다"고 밝혔다.
황 의원은 "스캐터랩이 문제를 인정하고 신속하게 대응에 나선 점에 감사드린다"며 "많은 청소년이 이용하는 AI 서비스인 만큼 보호 장치가 실제로 작동하는지 지속적으로 점검하고 다른 AI 챗봇 업체들도 청소년 보호 방안을 더 고도화해야 한다"고 말했다.
이어 "벤처·스타트업들이 AI 안전성 문제로 발목 잡히지 않도록 정부도 컨설팅 등 지원에 나서야 한다"고 말했다.
구글에서 프레시안을 더 자주 만나기



전체댓글 0