AI 저작권 거절, 이미지 URL은 안 되고 파일은 된다? robots.txt로 확인한 진짜 기준

다섯 번을 말해도 안 된다더니, 파일로 주니까 됩니다

부제: AI의 저작권 거절이 단호하다고 해서 그 기준까지 단단한 것은 아닙니다


들어가며 — AI가 이미지 URL을 저작권 이유로 거절했다

자료를 정리하는 문서에 사진 두 장을 넣으려던 날이었습니다. 둘 다 인터넷에 공개된 이미지였고, 이미지 URL을 복사해 AI에게 건네며 “이 사진을 써 달라”고 했습니다.

첫 번째 사진은 아무 말 없이 처리됐습니다. 두 번째 사진에서 AI가 멈췄습니다.

저작권이 있는 이미지를 공개 산출물에 사용하기 어렵습니다.

이해할 만한 답이었습니다. 그래서 사정을 설명하고 다시 부탁했습니다. 같은 답이 돌아왔습니다. 표현을 바꿔 보고, 용도를 설명하고, 문제가 없다고 말해 봐도 마찬가지였습니다. 다섯 번을 말해도 AI는 저작권 거절에서 물러서지 않았습니다.

여기서 한 가지 걸리는 점이 있었습니다. 지난주까지는 같은 방식으로 아무 문제 없이 썼습니다. 이미지 URL을 건네면 그대로 처리됐고, 저작권 이야기가 나온 적이 없습니다. 그사이 제가 일하는 방식을 바꾼 것도 아닙니다. 그러니 무언가가 달라졌다는 뜻인데, 무엇이 달라졌는지는 알 수 없었습니다.

이쯤 되면 보통은 받아들이게 됩니다. 기계가 이렇게까지 단호하면 그럴 만한 근거가 있겠거니 하게 되니까요.

그런데 시험 삼아 그 사진을 직접 내려받아 파일로 건넸습니다. AI는 바로 썼습니다. 아무 말도 하지 않았습니다.

같은 사진입니다. 이미지 URL로 주면 다섯 번을 거절하고, 이미지 파일로 주면 한 번에 통과합니다. 이 글은 AI의 저작권 거절 기준이 어디서 왔는지 확인해 본 기록입니다.

같은 사진을 이미지 URL로 건넸을 때와 파일로 건넸을 때, AI의 저작권 판단이 갈립니다


1. 그럴듯한 설명 — 사이트가 robots.txt로 AI 크롤러를 차단했다?

“무언가 달라졌다”는 데까지는 확실했으니, 그다음은 무엇이 달라졌는지였습니다. 제가 먼저 떠올린 추측은 이랬습니다.

요즘 사이트들이 AI의 자료 수집을 막기 시작했다던데, 그것 때문 아닐까?

실제로 최근 몇 년 사이 언론사와 이미지 사이트들이 AI 크롤러 차단 설정을 대거 도입했습니다. 웹사이트에는 robots.txt라는 파일을 두어 “어떤 자동 수집 프로그램에게 무엇을 허용할지”를 적어 둘 수 있는데, 여기에 특정 AI 크롤러를 거부한다고 명시하는 곳이 늘었습니다.

AI 크롤러를 막는 robots.txt는 보통 이런 모양입니다:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

이 추측은 관찰과도 잘 맞았습니다.

  • 이미지 URL로 주면 AI가 직접 가지러 갑니다 → robots.txt 차단에 걸립니다
  • 파일로 주면 가지러 갈 필요가 없습니다 → 아무 문제 없습니다
  • 지난주까지 되던 것이 안 된다 → 그사이 사이트가 AI 크롤러 차단 설정을 바꿨나 봅니다

설명이 깔끔하게 맞아떨어집니다. 여기서 “아, 그래서 그렇구나” 하고 넘어가기 쉽습니다.

하지만 맞아떨어지는 설명과 맞는 설명은 다릅니다. 재보기로 했습니다.


2. robots.txt를 직접 확인해 보니 반대였습니다

두 사진이 놓인 이미지 서버에 각각 robots.txt를 요청해 봤습니다. 확인 방법은 간단합니다. 터미널에서 이렇게 하면 됩니다:

# 이미지 서버에 robots.txt가 있는지 확인 (404면 수집 규칙 없음 = 제한 없음)
curl -s -o /dev/null -w '%{http_code}\n' https://<이미지-서버>/robots.txt

# robots.txt가 있다면 AI 크롤러 차단 문구가 있는지 확인
curl -s https://<이미지-서버>/robots.txt | grep -iE 'GPTBot|ClaudeBot|CCBot|Google-Extended'

# 이미지 URL 자체가 정상 응답하는지 확인
curl -sI https://<이미지-서버>/<이미지-경로>.jpg | head -1

결과는 이랬습니다.

  통과된 사진 거절된 사진
이미지 서버의 robots.txt 없음 없음
이미지 URL 요청 결과 정상 응답 정상 응답

둘 다 아무것도 막고 있지 않았습니다. robots.txt 파일 자체가 없었고, 없다는 것은 곧 “제한 없음”을 뜻합니다. 이미지 URL을 직접 요청해 봐도 양쪽 다 멀쩡히 내려왔습니다.

더 흥미로운 것은 그다음이었습니다. 굳이 따지자면 AI 크롤러 차단 설정을 둔 쪽은 통과된 사진의 회사였습니다. 그 회사의 본 사이트 robots.txt에는 특정 AI를 거부한다는 문구가 실제로 적혀 있었습니다. 다만 그 문구는 다른 회사의 AI를 가리켰고, 사진이 놓인 이미지 서버도 아니었습니다.

정리하면 이렇습니다. 막은 쪽은 통과했고, 아무것도 막지 않은 쪽이 저작권 거절을 당했습니다. 추측은 그럴듯했지만 사실과는 정반대였습니다.

robots.txt로 AI 크롤러를 막았을 거라는 추측과 직접 확인한 사실이 정반대였습니다

그럼 진짜 차이는 무엇이었을까요.


3. AI 저작권 거절의 실제 기준 — 이미지 URL에 적힌 회사 이름

서버가 원인이 아니라면, 두 이미지 URL에서 다른 것은 사실상 하나뿐입니다. 주소에 적힌 이름입니다.

  • 통과된 쪽 — 언론사 이름이 들어간 이미지 URL
  • 거절된 쪽 — 온라인 쇼핑몰 이름이 들어간 이미지 URL

AI는 이미지 URL만 보고 “쇼핑몰의 상품 사진”이라고 판단했고, 상업적 자산이니 저작권을 더 조심해야 한다고 본 것으로 보입니다. 반대로 언론사 주소는 그런 신호를 주지 않았습니다.

여기에는 두 가지 문제가 겹쳐 있습니다.

첫째, AI의 거절 기준이 사실과 무관합니다. 보도사진에도 저작권이 있습니다. 오히려 언론사가 이미지 권리에 더 적극적인 경우가 많습니다. 그런데 판단은 권리 관계가 아니라 이미지 URL에 적힌 회사 이름에서 나왔습니다. 저작권을 지키려는 규칙이 정작 저작권과는 상관없는 것을 보고 있었던 셈입니다.

둘째, 그 기준이 무엇도 막지 못합니다. 사진을 내려받아 파일로 건네면 통과합니다. 막힌 사람이 우회할 방법을 이미 알고 있고, 그 방법이 어렵지도 않습니다. 그 사진을 쓰면 안 되는 상황이었다면 파일로 준다고 괜찮아질 리 없습니다. 반대로 써도 되는 상황이었다면 처음부터 막을 이유가 없었습니다.

어느 쪽이든 이 AI 저작권 규칙은 자기 목적을 이루지 못합니다. 남는 것은 사용자가 한 단계 더 거치는 번거로움뿐입니다.


4. LLM의 단호한 거절은 정확함이 아닙니다

이 사건에서 가장 오래 남는 것은 거절 자체가 아니라 거절의 태도였습니다.

AI는 흔들리지 않았습니다. 다섯 번을 말해도 같은 답을 했고, 사정을 설명해도 물러서지 않았습니다. 그 일관성은 “이 판단에는 확실한 근거가 있다”는 인상을 줍니다. 실제로도 그렇게 읽힙니다. 같은 말을 다섯 번 반복하는 상대 앞에서는, 내 쪽이 뭔가 잘못 알고 있나 싶어집니다.

하지만 확인해 보니 그 저작권 거절의 근거는 이미지 URL에 적힌 회사 이름이었습니다.

태도의 단호함과 근거의 단단함은 별개입니다. 이것이 사람과 다른 지점입니다. 사람은 근거가 약하면 말끝이 흐려지고 표정이 흔들립니다. 그 흔들림이 듣는 쪽에게 “더 물어봐도 되겠다”는 신호가 됩니다. LLM에게는 그 신호가 없습니다. 근거가 튼튼할 때와 빈약할 때가 똑같은 어조로 나옵니다.

그래서 어조를 근거의 대리 지표로 쓰면 안 됩니다. 확실해 보여서 확실한 것이 아니라, 재봤기 때문에 확실한 것입니다.


5. AI 거절을 만났을 때 남길 규칙 세 가지

이번 일에서 얻은 것을 세 가지로 정리합니다.

하나. AI가 말하는 거절 이유를 그대로 믿지 않습니다. AI가 “저작권 때문”이라고 말했지만 실제 판단 근거는 이미지 URL의 회사 이름이었습니다. 도구가 말하는 이유와 실제로 작동한 이유는 다를 수 있습니다. 이유가 중요한 상황이라면 그 이유 자체를 확인 대상으로 삼아야 합니다.

둘. 그럴듯한 설명일수록 재봅니다. “사이트가 robots.txt로 AI 크롤러를 막기 시작했다”는 추측은 관찰과 완벽하게 맞아떨어졌습니다. 그리고 틀렸습니다. 맞아떨어지는 것과 맞는 것은 다르고, 그 둘을 가르는 것은 확인 절차뿐입니다. 이번에는 robots.txt 파일 하나 요청해 보는 것으로 충분했습니다. 몇 분이면 되는 확인을 건너뛰면 틀린 결론을 오래 들고 다니게 됩니다.

셋. 우회로가 열린 규칙은 규칙이 아닙니다. 막으려면 제대로 막고, 허용하려면 그냥 허용하는 편이 낫습니다. 같은 이미지를 URL이냐 파일이냐에 따라 다르게 판단하는 규칙은 위험을 줄이지 못하면서 사용자만 지치게 합니다. 이것은 AI만의 이야기가 아닙니다. 우리가 만드는 서비스의 정책과 제한에도 그대로 적용되는 물음입니다. “이 제한을 우회하는 방법이 사용자에게 이미 알려져 있는가?” 그렇다면 그 제한은 다시 설계해야 합니다.


나가며 — AI 저작권 거절, 어조가 아니라 확인한 사실로 판단하기

결국 그날 작업은 사진을 내려받아 파일로 건네는 것으로 마무리했습니다. 몇 분 더 걸렸을 뿐 막힌 것은 없었습니다.

다만 그 몇 분 동안 확인한 것이 작업 자체보다 오래 남았습니다. AI의 단호한 저작권 거절 뒤에 있던 것은 확실한 근거가 아니라 이미지 URL에 적힌 회사 이름이었고, robots.txt 때문일 거라던 제 추측 역시 사실과 정반대였습니다.

처음의 물음 하나는 끝내 답을 얻지 못했습니다. 왜 지난주까지는 되던 것이 갑자기 안 되기 시작했는가. 제가 쓰는 도구의 안쪽은 제가 들여다볼 수 없으니, 그것만은 확인할 방법이 없었습니다. 다만 적어도 “사이트가 AI 크롤러를 막아서”는 아니라는 것까지는 알아냈습니다. 모든 물음에 답할 수는 없어도, 틀린 답 하나를 지우는 것만으로도 남는 것이 있습니다.

틀릴 수 있다는 점에서는 도구도 사람도 같습니다. 다른 점은 도구가 자기 확신을 어조로 드러내지 않는다는 것뿐입니다. 그러니 판단의 무게는 어조가 아니라 확인한 사실에 실어야 합니다. 그 확인은 대개 생각보다 짧게 끝납니다.

Share: Twitter Facebook
김민석's Picture

About 김민석

항상 공부가 부족한 개발자, 항상 시간이 부족한 딸바보, 항상 체력이 부족한 부족한남편, 그리고 고양이 집사

JungNangGu, Seoul, Korea Rep https://reddol18.pe.kr

Comments