AI 기반 웹 크롤러 및 스크래퍼는 원본 콘텐츠를 도용하고 웹사이트 방문자를 제한합니다. 웹사이트 소유자 및 콘텐츠 퍼블리셔가 웹 스크래핑에 대한 통제력을 되찾는 방법을 알아보세요.
이 글을 읽은 후에 다음을 할 수 있습니다:
글 링크 복사
웹사이트 스크래핑이라고도 하는 웹 스크래핑은 웹 사이트에서 데이터 또는 콘텐츠를 추출하는 자동화된 프로세스입니다. 원래는 검색 엔진이 사용자가 원하는 특정 콘텐츠를 보다 효율적으로 찾을 수 있도록 돕기 위해 고안된, 널리 알려진 인터넷 방식입니다. 기본적으로,크롤러라고도 하는 웹 스크래퍼는 검색 엔진의 색인에서 웹 사이트를 "크롤링"하고 콘텐츠를 추출하여 분류합니다.
초기에 웹 스크래핑은 대부분의 관련 당사자들에게 꽤 효과적이었습니다.
콘텐츠 제공업체는 콘텐츠를 계속 업데이트하도록 장려되었고, 사용자, 검색 엔진, 콘텐츠 제공업체 모두가 원하는 것을 얻고 비교적 안정적인 삼각형 항상성 상태를 유지하면서 시스템은 전반적으로 비교적 원활하게 작동했습니다.
웹 스크래핑 생태계는 초기에는 잘 작동했지만, 공격과 오용에 취약합니다. 다음과 같은 예를 들 수 있습니다.
과도한 웹 스크래핑이 비즈니스에 직접적인 위협이 된다는 것을 깨닫고 콘텐츠 제공업체는 봇 관리 및 웹 애플리케이션 방화벽(WAF) 솔루션을 포함하여 IP 도용 및 과도한 스크래핑에 대한 다양한 방어 기능을 구현했습니다. 많은 업체들이 robots.txt 파일도 구현했는데, 이 파일은 봇이 웹사이트와 상호 작용하는 방법에 대한 가이드라인을 제공하지만, 이 파일은 봇이 ‘올바르게 행동할 것’이라는 가정에 의존하기 때문에 종종 무시됩니다.
이러한 웹 스크래핑 방어는 정교한 공격자가 회피를 위한 봇, 기법 및 기술을 사용하여 무력화할 수 있습니다. 웹사이트 소유자는 독점 데이터 도난 및 가격, 제품 정보 유출이 증가하는 추세이며, 이는 경쟁 우위 약화로 이어지고 있습니다.
점점 더 많은 검색 엔진 및 인공지능(AI) 회사에서 웹 스크래퍼를 대규모 언어 모델(LLM)과 함께 사용하여 웹사이트에서 콘텐츠를 수집한 다음 요약된 버전을 사용자에게 제공하고 있습니다. 검색 엔진 또는 생성형 AI(GenAI) 도구에서 AI 생성 요약을 읽으면 정보를 더 빠르게 제공하여 사용자의 작업 단계를 줄일 수 있습니다. 그러나 이러한 행위는 웹사이트 소유자 및 콘텐츠 퍼블리셔에게 유해하고 파괴적일 수도 있습니다.
수입이 줄어들면서 콘텐츠 퍼블리셔는 독창적이고 시의적절한 콘텐츠를 만들 동기와 자금이 줄어듭니다. 그리고 이들이 콘텐츠 생산을 줄이게 되면, LLM이 신뢰할 수 있는 합법적 출처로부터 얻을 수 있는 정보의 양도 줄어들게 되어, 새로운 정보의 흐름과 확산이 더욱 위축될 것입니다.
많은 블로거와 기타 콘텐츠 제작자는 비교적 간단하고 비전문적인 인터페이스 덕분에 WordPress를 계속 사용합니다. WordPress 사용자들은 웹 스크래핑에 대응하기 위해 여러 가지 방안을 도입해왔습니다. 예를 들어, robots.txt 프로토콜 을 사용해 정상적인 크롤러가 콘텐츠를 적절히 탐색하도록 안내하거나, 고급 CAPTCHA 인증 방식을 적용해 악성 봇을 차단하고 정상 트래픽과 구분하는 등의 방법이 있습니다. 일부는 또한 고급 보안 조치를 사용하여 의심스러운 주소를 차단하고, 레이트 리미팅을 통해 사이트 트래픽 부하 및 리소스 할당에 대한 부담을 줄입니다.
콘텐츠 퍼블리셔에게 콘텐츠는 그야말로 사업의 전부입니다. 과도하고 악의적인 웹 스크래핑 방지가 최우선 과제여야 합니다.
몇 가지 모범 사례를 따르면 큰 차이를 만들 수 있습니다.
Cloudflare에서는 웹 사이트 소유자와 콘텐츠 퍼블리셔가 웹 스크래핑에 대한 통제력을 되찾을 수 있도록 지원합니다. Cloudflare AI Crawl Control은 AI 크롤링 및 스크래핑 활동에 대한 완전한 가시성을 제공합니다. 클릭 한 번으로 크롤러를 허용하거나 차단할 수 있고, 사이트에서 특정 페이지 또는 콘텐츠 유형으로 스크래핑을 제한하며, 특정 IP 주소의 활동 속도를 늦추거나 차단할 수 있습니다. 직관적인 단일 대시보드에서 모든 것을 관리할 수 있습니다. Cloudflare Bot Management는 좋은 봇과 나쁜 봇을 실시간으로 구별하여 좋은 봇이 사이트를 크롤링하도록 허용하고 유해한 봇은 차단합니다.
Cloudflare를 통해 콘텐츠에 대한 통제력을 되찾는 방법을 자세히 알아보세요.
웹 스크래핑 또는 웹사이트 스크래핑은 웹사이트에서 데이터 또는 콘텐츠를 추출하는 데 사용되는 자동화된 프로세스입니다. 원래 이 기술은 검색 엔진이 콘텐츠를 더욱 효율적으로 분류하고, 사용자가 특정 정보를 쉽게 찾을 수 있도록 돕기 위해 고안되었습니다.
초기에 웹 스크래핑은 사용자들이 포괄적이고 정확한 웹 콘텐츠 목록에 접근하는 데 기여했습니다. 또한 콘텐츠 제공업체는 고유한 지적 재산(IP)을 통해 수익을 창출할 수 있었습니다.
과도한 웹 스크래핑은 콘텐츠 도용 및 사이트 성능 저하를 야기할 수 있습니다. 봇이 반복적으로 사이트를 스크래핑하면 페이지 로드 시간이 증가하면서 사용자 만족도를 떨어뜨리고, 콘텐츠 제공업체의 입장에서는 비용 증가로 이어집니다.
콘텐츠 제공업체는 일반적으로 봇 관리 및 웹 애플리케이션 방화벽(WAF) 솔루션과 같은 방어 기술을 사용하여 IP 도용 및 과도한 스크래핑을 방지합니다. 악성 봇에 의해 무시되는 경우가 많긴 하지만, 일반적으로 robots.txt 파일도 구현합니다.
검색 엔진 및 AI 기업은 대규모 언어 모델(LLM)과 함께 웹 스크래퍼를 사용하여 콘텐츠를 수집하고 사용자에게 요약된 버전을 제공합니다. 그러면 추천 트래픽이 줄어들고 퍼블리셔 수익은 줄어들게 됩니다.
퍼블리셔는 허용되는 스크래핑 양을 제한하여 불필요하고 악의적인 웹 스크래핑을 줄여야 합니다. 또한 AI 기반 솔루션을 사용하여 고도화된 AI 기반 봇을 방어하고, AI 스크래퍼가 사이트에 액세스할 때 요금을 부과하는 보상 모델을 구현할 수도 있습니다.
많은 WordPress 사용자가 합법적인 크롤러를 안내하기 위해 robots.txt 프로토콜을 사용합니다. 또한 고급 CAPTCHA 식별 방법을 사용하여 악성 봇을 차단하고 실제 사용자 트래픽과 분리합니다. 보안 조치를 통해 의심스러운 주소를 차단하고 레이트 리미팅을 적용하는 경우도 있습니다.
Cloudflare AI Crawl Control은 AI 크롤링 활동에 대한 가시성을 제공하고 퍼블리셔가 클릭 한 번으로 특정 크롤러를 차단, 제한하거나 속도를 늦출 수 있도록 해줍니다. Cloudflare Bot Management는 실시간으로 좋은 봇과 나쁜 봇을 구별하여 좋은 봇이 사이트를 크롤링하도록 허용하고 나쁜 봇을 차단합니다.
시작하기
인공 지능
머신러닝
빅 데이터
용어
학습 센터