AI가 쓴 글, 이제 들킬까? ChatGPT의 보이지 않는 워터마크와 그 한계
OpenAI가 AI로 작성한 글에 보이지 않는 워터마크를 넣기 시작했다. 클로드에 이어 ChatGPT까지 합류하면서 AI 텍스트의 출처를 확인하려는 움직임이 본격화됐다.

20초 핵심
1. 글에 어떻게 보이지 않는 표시를 남길까?
워터마크라고 해서 글자 사이에 특수문자나 보이지 않는 공백을 넣는 방식은 아니다.
AI는 문장을 쓸 때 다음에 올 단어의 확률을 계산한다. 가령 ‘오늘 점심은’이라는 문장 다음에 ‘김치찌개’, ‘파스타’, ‘샐러드’ 등 여러 선택지가 존재한다.
textGrain은 이 선택 확률을 비밀 규칙에 따라 미세하게 조정한다. 수백 개의 단어가 쌓이면 일반적인 문장과 구별되는 통계적 패턴이 형성된다.
특정 단어를 무조건 삽입하는 방식이 아니라, 여러 단어 선택에서 축적되는 통계적 신호를 확인하는 방식.
독자는 차이를 알아채기 어렵지만 동일한 비밀 규칙을 가진 탐지기는 패턴을 검사할 수 있다. 복사해서 붙여넣어도 문장이 그대로라면 흔적이 남을 가능성이 있다.
2. 단어 몇 개만 바꿔도 탐지력이 급감
OpenAI가 공개한 실험은 기술의 가능성과 한계를 동시에 보여준다.
영어 400토큰 글의 워터마크 탐지율
OpenAI ELI5 데이터 실험. 단어를 동의어로 치환. 목표 오탐률 1%. 일상 사용 환경 전체의 정확도를 뜻하지 않음.
동의어로 단어 10%를 교체하자 탐지율이 26%포인트 하락했고, 25%를 교체하면 75%포인트 하락했다.
글의 길이도 변수다. 심리학 관련 문장에서는 200토큰일 때 약 80%, 400토큰일 때 약 95%의 탐지율을 기록했다. 반면 수학처럼 표현의 자유도가 낮은 분야는 탐지력이 더 약했다.
여기서 반드시 구분할 숫자가 있다. 오탐률 1%는 AI가 쓴 글을 99% 정확하게 찾아낸다는 뜻이 아니다. 사람이 작성한 글을 잘못 지목할 가능성을 설정한 실험 조건이다.
3. 그런데 왜 탐지기를 공개하지 않을까?
현재 OpenAI의 텍스트 워터마크 탐지기는 승인받은 연구기관과 전문가 조직에 한해 접근 신청이 가능하다. 일반 사용자, 학교, 공모전 주최자가 누구나 사용할 수 있는 공개 판별기는 아니다.
탐지기가 공개되면 이를 우회하는 도구가 발전할 수 있다. 동시에 탐지 결과를 맥락 없이 활용해 사람을 부당하게 의심할 위험도 있다.
두 문제는 방향이 다르지만 같은 한계를 보여준다. 워터마크의 목적은 생성 출처에 관한 추가 신호를 제공하는 것이지, 최종 판결을 내리는 것이 아니다.
EU AI Act 제50조 역시 생성 콘텐츠의 기계 판독 가능한 표시를 요구하지만, AI가 관여한 모든 글을 부정행위로 취급하지는 않는다. 공익적 정보 제공 목적의 AI 생성 텍스트에도 인간의 검토와 편집 책임에 관한 예외 규정이 존재한다.
4. 정말 중요한 질문 - AI가 썼나, 누가 책임졌나?
같은 워터마크가 남아 있어도 창작 과정은 완전히 다를 수 있다.
| 사례 | 워터마크로 알기 어려운 것 |
|---|---|
| AI 초안을 그대로 제출 | 작성 과정의 실제 책임 |
| AI 자료조사 후 인간이 집필 | 인간의 독자적 기여 |
| 인간 원고를 AI로 교정 | AI가 바꾼 범위 |
| AI 글을 대폭 수정 | 탐지되지 않는 AI 사용 |
워터마크가 발견됐다고 해당 글의 모든 생각이 AI에서 나왔다는 의미는 아니다. 반대로 워터마크가 없다고 사람이 직접 썼다는 증거도 아니다.
이 때문에 교육기관과 공모전 주최자에게 필요한 것은 탐지 점수 하나보다 작성 이력, 초안, 인용 출처, AI 사용 범위에 관한 명확한 기준일 수 있다.
AI 작성 여부를 가리는 경쟁에서, AI 사용의 책임을 확인하는 체계로 옮겨갈 가능성.
이번 변화는 AI를 이용한 창작을 막는 조치라기보다 그 출처를 추적할 최소한의 기반을 만들려는 시도에 가깝다.
다만 시장에 여러 AI 모델이 존재하고, 번역과 재작성만으로 신호가 약해질 수 있는 상황에서 워터마크를 단일한 진위 판정 도구로 사용하기는 어렵다.
앞으로의 핵심은 더 높은 탐지율뿐 아니라, 서로 다른 기업의 표시 체계가 호환되는지, 결과를 어떤 증거 기준으로 활용하는지 에 달려 있다.
- 지원 모델에서 워터마크가 적용된 글이고 문장이 유지됐다면 통계적 신호도 남을 가능성. 그러나 모든 글의 탐지를 보장하지는 않음.
- EU의 ChatGPT와 Codex가 우선 적용 대상. 한국을 포함한 글로벌 API 고객은 지원 모델에서 선택적으로 활성화 가능. 국내 ChatGPT 전체의 기본 적용은 별개.
- 탐지 결과는 AI 모델 관여 가능성에 관한 기술적 증거. 부정행위 여부는 과제 규정과 실제 작성 과정 등을 함께 검토할 문제.
- 워터마크가 약해지거나 없어질 수는 있지만, 그것만으로 인간이 창작했다는 의미는 아님. 출처 탐지와 창작 기여도 판단은 서로 다른 문제.
체크 포인트
인사이트 타임스 편집부





