Гонка за блокировку парсинг-ботов OpenAI замедляется

Пока слишком рано говорить о том, как изменится поток сделок между ИИ-компаниями и издателями. Однако OpenAI уже одержал одну явную победу: его веб-сканеры не блокируются ведущими новостными агентствами с такой скоростью, как раньше.

Бум генеративного ИИ спровоцировал золотую лихорадку данных — и последующую лихорадку защиты данных (по крайней мере, для большинства новостных веб-сайтов), в ходе которой издатели стремились заблокировать сканеры ИИ и не допустить, чтобы их работа стала обучающими данными без согласия. Когда этим летом Apple представила нового агента искусственного интеллекта, множество ведущих новостных агентств быстро отказались от очистки веб-страниц Apple, используя протокол исключения роботов, или robots.txt, файл, который позволяет веб-мастерам управлять ботами. На сцене так много новых ботов с искусственным интеллектом, что может показаться, что нужно играть в «ударь крота», чтобы не отставать.

GPTBot от OpenAI имеет наиболее узнаваемое имя, а также его чаще блокируют, чем у конкурентов, таких как Google AI. Число высокорейтинговых медиа-сайтов, использующих robots.txt для «запрета» OpenAI GPTBot, резко возросло с момента его запуска в августе 2023 года до этой осени, а затем постепенно (но более постепенно) росло с ноября 2023 года по апрель 2024 года, согласно анализу 1000 популярные новостные агентства, созданные стартапом по обнаружению искусственного интеллекта Originality AI из Онтарио. На пике популярности этот показатель составлял чуть более трети веб-сайтов; теперь он упал примерно на четверть. В небольшом пуле наиболее известных новостных агентств уровень блокировки по-прежнему превышает 50 процентов, но он ниже, чем в начале этого года, составлявший почти 90 процентов.

Но в мае прошлого года, после того как Дотдаш Мередит объявил о лицензионном соглашении с OpenAI, это число значительно снизилось. Затем он снова упал в конце мая, когда Vox объявил о своем собственном соглашении, и еще раз в августе этого года, когда материнская компания WIRED, Condé Nast, заключила сделку. Тенденция к увеличению блокировок, похоже, закончилась, по крайней мере, на данный момент.

Эти провалы имеют очевидный смысл. Когда компании вступают в партнерские отношения и дают разрешение на использование своих данных, у них больше нет стимула блокировать их, поэтому из этого следует, что они обновят свои файлы robots.txt, чтобы разрешить сканирование; заключите достаточное количество сделок, и общий процент сайтов, блокирующих сканеры, почти наверняка снизится. Некоторые СМИ разблокировали сканеры OpenAI в тот же день, когда объявили о сделке, например The Atlantic. Другим потребовалось от нескольких дней до нескольких недель, как, например, Vox, который объявил о своем партнерстве в конце мая, но разблокировал GPTBot на своих ресурсах к концу июня.

Robots.txt не имеет юридической силы, но уже давно является стандартом, регулирующим поведение веб-сканеров. На протяжении большей части существования Интернета люди, управляющие веб-страницами, ожидали, что друг от друга будут соблюдать файл. Когда ранее этим летом расследование WIRED показало, что стартап Perplexity, занимающийся искусственным интеллектом, скорее всего, решил игнорировать команды robots.txt, облачное подразделение Amazon начало расследование того, нарушил ли Perplexity его правила. Нехорошо игнорировать robots.txt, что, вероятно, объясняет, почему так много известных компаний, занимающихся искусственным интеллектом, включая OpenAI, прямо заявляют, что используют его, чтобы определить, что сканировать. Генеральный директор Originality AI Джон Гиллхэм считает, что это придает дополнительную актуальность усилиям OpenAI по заключению соглашений. «Очевидно, что OpenAI рассматривает блокировку как угрозу своим будущим амбициям», — говорит Гиллхэм.

Основатель более 10 стартапов в области ИТ и ИИ. Серийный предприниматель. Профессиональный управленец.