Новые достижения в генерации видео от OpenAI и Google
В этом месяце компания OpenAI представила Sora, свою мощную модель генерации видео на основе текста, доступную для пользователей ChatGPT Plus с функцией Sora Turbo. Теперь Google готовится к соревнованиям с запуском своей самой продвинутой модели генерации видео.
Запуск Veo 2 от Google
В понедельник Google представил Veo 2 — генератор видео на основе текста. Он обладает улучшениями по сравнению с предыдущими моделями компании, включая:
- Лучшее понимание реальной физики
- Улучшенная детализация и реализм
- Поддержка разрешения до 4K
По мнению Google, Veo 2 справляется с распространенными проблемами генерации видео, такими как «галлюцинации» — например, появление лишних пальцев. При оценке работы Veo 2 с другими ведущими моделями, такими как Sora Turbo, Kiling v1.5 и Meta Movie Gen, пользователи признали Veo 2 лучшим по общей производительности и соблюдению заданий.
Кинематографические возможности Veo 2
Veo 2 также понимает кинематографический язык, включая жанр, объектив и угол съемки. Например, если пользователь укажет «малая глубина резкости», модель размоет фон объекта, чтобы создать нужный эффект. Видео, созданное с помощью Veo 2, может быть выполнено, например, с использованием объектива 35 мм на пленке Kodak Portra 400.
Доступ к Veo 2
Модель доступна для общественности через VideoFX в Google Labs. Форма ожидания раннего доступа требует указать основную информацию:
- Имя
- Возраст
- Место жительства
- Соответствующая работа
- Как вы узнали о проекте
Google рассматривает заявки на регулярной основе.
Улучшения в генерации изображений
Кроме Veo 2, Google обновил свою модель Imagen 3 для генерации изображений. Улучшенная версия может создавать:
- Более яркие и хорошо составленные изображения
- Разнообразные стили
- Изображения с высоким соответствием запросам
- Более насыщенные детали и текстуры
Новый эксперимент — Whisk
Google также представил новый эксперимент под названием Whisk, который доступен в Labs. Этот инструмент позволяет пользователям создать изображение или загрузить свое и преобразовать его в новую картинку в стиле мягкой игрушки, значка или наклейки. Whisk использует технологии Imagen 3 и Gemini, создавая подробные подписи для ваших изображений, которые затем подаются в Imagen 3 для финального продукта.
Заключение
С запуском Veo 2 и улучшениями в моделях генерации изображений, Google делает значительные шаги в сфере искусственного интеллекта. Эти инструменты откроют новые возможности для креативных профессионалов и любителей.
Получайте удовольствие от новых технологий и используйте их в своих проектах!
