
제목 데이터 스크래핑 관련 법적 다툼 속 Reddit가 Perplexity를 겨냥해 만든 함정
요약
- Reddit은 인공지능 기업 Perplexity가 Reddit의 콘텐츠를 차단하라는 지침을 무시하고 계속 데이터를 활용했다고 주장합니다.
- 또 Perplexity와 Reddit 간에 콘텐츠 라이선스가 실제로 존재하지 않는다고 지적하며, Perplexity가 구글의 검색결과(SERP)를 우회해 데이터를 얻었을 가능성을 제시합니다.
- Reddit은 Perplexity와 데이터 스크래핑 업체 Oxylabs, AWM Proxy, SerpApi를 상대로 소송을 제기했고, 테스트 포스트를 통해 구글 크롤러만 접근 가능하도록 함정(트랩)을 만들었다고 주장합니다.
- Perplexity 측은 공개성과 공익에 대한 위협은 용납하지 않겠다고 반응했고, 콘텐츠를 학습에 사용하지 않는다고 밝힌 바 있습니다.
- 이 사건은 AI 모델의 학습 데이터 출처와 법적 책임에 대한 논쟁을 다시 부상시키고 있습니다.
자세한 내용
- 핵심 쟁점은 Perplexity가 Reddit의 데이터를 합의된 차단 규정을 어기고 계속 사용했는지와, 데이터가 라이선스 없이 수집되었는지입니다.
- Reddit은 Perplexity의 응답에서 Reddit 데이터를 지속적으로 인용하는 현상이 라이선스 없이 이뤄진 것으로 보인다고 주장합니다.
- 소송에는 Perplexity뿐 아니라 데이터 스크래핑 업체인 Oxylabs UAB, AWM Proxy, SerpApi도 피소되었으며, Reddit은 이들이 Reddit의 게시물을 허가 없이 가져가 Perplexity에 팔았을 가능성을 제기합니다.
- Reddit은 시험 삼아 만든 ‘트랩’ 포스트를 통해 구글 검색 엔진(Google SERP)으로만 크롤링이 가능하게 구성했고, Perplexity가 구글 SERP를 통해 데이터를 얻었을 경우에 한해 Reddit 데이터에 접근했을 가능성이 있다고 주장합니다.
- Perplexity는 법적 대응에 대해 공익과 개방성에 대한 위협은 용납하지 않겠다고 밝히며, 콘텐츠를 학습에 사용하지 않는다고 반박했습니다.
- Cloudflare의 이전 사례와 비교되는 부분도 언급되며, 데이터 접근과 검열에 관한 업계의 논의가 다시 점화되고 있습니다.