Главные риски использования контента для обучения ИИ в бизнесе

Организациям следует уже сейчас изучить материалы, используемые в работе с искусственным интеллектом: выяснить источники данных и условия их применения. Эксперты единодушны в том, что бизнесу важно провести инвентаризацию контента, собрать необходимые документы и четко распределить ответственность между разработчиками и подрядчиками.

Катерина Игрунова, CEO & Founder M.A.F.I.A. Agency, считает, что с развитием ИИ ярче обозначилась уже существующая проблема компаний с источниками контента и правами на него.

«На мой взгляд, ИИ не столько создал новую проблему, сколько сделал заметнее старую: многие компании не могут объяснить, откуда берется их контент и кому принадлежат права на него», — говорит Катерина Игрунова.

По ее мнению, важно собирать все документы, в том числе договора, технические задания и акты, о передаче исключительных прав или лицензий, а также согласия авторов и модели. Для материалов, созданных с помощью ИИ, Игрунова рекомендует сохранять исходный бриф, историю генераций и последующую ручную доработку. В договорах с подрядчиками необходимо отдельно фиксировать ответственность за входные данные и конечный продукт.

Данильчик Артур, руководитель отдела маркетинга WMT AI, выделяет этапом подготовки определение всех датасетов, используемых в процессе работы с ИИ: обучающие выборки, корпоративные хранилища и контент для сценариев.

«Затем следует классифицировать данные на категории: собственные материалы компании, данные клиентов, закупленный/лицензированный контент и открытые источники. Для каждой категории нужно уточнить: кто владелец, какие ограничения уже установлены и какие наборы нельзя использовать даже для тестов», — говорит Данильчик.

По его словам, для подтверждения законного использования данных компании нужна не одна бумага, а система. Это могут быть реестр источников, договоры с правообладателями и при работе с персональными данными — пользовательские соглашения и отдельные согласия. Также в договорах нужно обозначить, кто несет ответственность за происхождение обучающих данных и действия сторон в случае нарушения прав третьих лиц.

Петр Сухоруких, основатель международного репутационного агентства «Невидимка», эксперт по антикризисному PR, также подчеркивает необходимость документирования происхождения используемых материалов.

«Главным доказательством служит корректный трудовой договор или контракт с подрядчиком, в котором четко прописан переход исключительных прав на созданный контент к вашей компании. Я настаиваю на том, чтобы к нему прилагались акты приема-передачи каждого конкретного текста или изображения», — уверен эксперт.

Для цифровых данных он предлагает сохранять исходные файлы с метаданными и фиксировать дату создания через внутренние программы. При покупке прав на использование чужого архива, по словам Сухоруких, должен быть лицензионный договор с разрешением на машинное обучение. При этом ответственность за обучающие данные в контрактах с поставщиками ИИ должен нести разработчик.

Генеральный директор ООО «Рокет груп» (Rocket Group) Борис Латкин считает, что компании должны уже сейчас проводить аудит использованных для обучения моделей наборов данных.

«Необходимо понимать происхождение каждого массива, правовые основания его использования, действующие ограничения и условия передачи третьим лицам. В будущем такой реестр станет такой же обязательной частью управления ИИ, как сегодня реестр программного обеспечения», — заключил Борис Латкин.

По его мнению, стоит уделить внимание договорам с разработчиками и поставщиками ИИ. Заказчику важно знать, какие данные использовались при обучении модели и есть ли права на их использование.

Дамир Фейзуллов, директор по Digital & Social Media в PR Partner, также рекомендует начать с инвентаризации данных, не дожидаясь дополнительных разъяснений.

«Компании важно понимать, какие материалы используются для обучения моделей, откуда они получены и на каких основаниях. Необходимо проверить корпоративные архивы, фото-банки и личные данные», — отметил эксперт.

Фейзуллов также акцентирует внимание на данных, которые сотрудники загружают в публичные нейросети. Для каждого набора он предлагает создать паспорт с указанием источника, даты получения и условий использования. Подтверждением законности могут служить договоры, акты передачи прав и лицензии.

ИИ-инженер и управляющий партнер компании «Зинин, Штурбин и партнеры» Тим Зинин предлагает распределить документы по происхождению и отдельно работать с материалами, положение которых пока неясно.

«Практический порядок такой: пройти по папкам и обозначить каждый источник в одной из трех категорий — создано внутри компании, получено от подрядчика по контракту, взято из внешнего источника без ясного основания. Третья категория остается вне индекса до выяснения», — рассказал Тим Зинин.

Фиксировать происхождение данных можно через акт с подрядчиком с перечнем переданных материалов, поле «источник» в системе хранения и лог загрузки с датой и ответственным специалистом. Перед подписанием договора с поставщиком ИИ-услуг Зинин рекомендует выяснять, используются ли запросы и загруженные документы для дообучения модели, возможна ли отключить эту опцию и доступна ли выгрузка логов.

Таким образом, в подготовке к возможному уточнению правил эксперты выделяют несколько практических задач: инвентаризацию данных, фиксацию происхождения и правовых оснований, создание реестров и архивов подтверждающих документов, а также более четкое распределение ответственности между заказчиками, подрядчиками и поставщиками ИИ-сервисов.

ОСТАВЬТЕ ОТВЕТ

Пожалуйста, введите ваш комментарий!
пожалуйста, введите ваше имя здесь

Основатель более 10 стартапов в области ИТ и ИИ. Серийный предприниматель. Профессиональный управленец.