Согласно команде разработчиков ByteDance, мультимодальная модель OmniHuman-1 способна создавать увлекательные видеоролики с говорящими, поющими и движущимися персонажами, которые превосходят по качеству «современные методы генерации видео».
Данная технология искусственного интеллекта, создающая изображения, видео и звуки, имитирующие реальных людей, известна как «дипфейк» — она часто применяется как в мошенничестве, так и в развлекательной индустрии.
ByteDance является одной из самых перспективных компаний в области искусственного интеллекта в Китае. Приложение Doubao от компании завоевало огромную популярность среди пользователей материкового Китая.
Хотя OmniHuman-1 еще не была официально представлена, видеоролики с примерами её работы быстро стали вирусными.
Одним из ярких примеров является 23-секундное видео, на котором Альберт Эйнштейн произносит речь. TechCrunch охарактеризовал продукцию приложения как «шокирующе потрясающую» и «самые реалистичные deepfake-видео на сегодняшний день».
Согласно разработчикам, для генерации видео любой длины OmniHuman-1 требуется всего лишь одно изображение в качестве референса и аудиоданные, такие как голос или вокал.
Частоту кадров выходного видео можно настраивать, как и «пропорции тела» персонажа.

К тому же, модель ИИ, обученная на 19 000 часах видеоматериала из закрытых источников, также может редактировать существующие видео, включая изменение жестов человеческих рук и ног с высокой степенью реализма.
Тем не менее, ByteDance признала, что OmniHuman-1 не идеальна: у нее все еще возникают сложности с определенными позами, и «низкокачественные референсные изображения» мешают созданию качественных видео.
Новая модель искусственного интеллекта от ByteDance демонстрирует прогресс Китая, несмотря на усилия Вашингтона ограничить экспорт технологий.
Обеспокоенность
В прошлом году в мире начали распространяться политические дипфейки. В Молдове появились фальшивые видеоролики с речью президента страны Майи Санду о ее отставке.
Кроме того, в Южной Африке в преддверии выборов вирусным стал дипфейк с изображением рэпера Эминема, который якобы поддерживает оппозиционную партию.
Дипфейки также все чаще используются для финансовых преступлений. Люди обманываются фальшивыми знаменитостями, которые рекомендуют инвестиции и предлагают поддельные инвестиционные возможности, а компании теряют миллионы долларов из-за мошенников, выдающих себя за высокопрофильных руководителей.
По данным Deloitte, в 2023 году потери от мошенничества в результате использования контента, созданного с помощью ИИ, составили более 12 миллиардов долларов, а к 2027 году эта сумма может достигнуть 40 миллиардов долларов в США.
В феврале прошлого года сотни людей из сферы ИИ подписали открытое письмо, призывающее к строгому регулированию дипфейков. В связи с отсутствием федеральной уголовной ответственности за дипфейк в США более 10 штатов приняли законы против использования ИИ для подделки.
Тем не менее, выявить дипфейки непросто. Несмотря на меры, предпринятые некоторыми социальными сетями и поисковыми системами для ограничения их распространения, количество контента с дипфейками в интернете продолжает расти с угрожающей скоростью.
В опросе, проведенном в мае 2024 года компанией Jumio, занимающейся проверкой личности, 60% респондентов заявили, что сталкивались с дипфейком за последний год; 72% выразили обеспокоенность тем, что дипфейки ежедневно обманывают их, в то время как большинство высказало поддержку за принятие законов, направленных на борьбу с распространением фальшивых видеороликов, созданных с помощью ИИ.
Google «дала добро» на использование ИИ для разработки оружия и технологий наблюдения Google отказалась от своего «обещания» не разрабатывать и не внедрять инструменты ИИ для использования в оружии и технологиях наблюдения.