• Новости
  • Генерация видео
  • Генерация изображений
Блог об умном ИИ
  • Генерация звука
  • Генерация текста
  • Обзор сервисов
Автор

admin

admin

    Генерация видео

    Grok Imagine получил референсы персонажей и голоса: xAI добавила генерацию видео в 1080p

    admin 05.09.2026


    xAI добавила в Grok Imagine референсы: до семи опорных изображений на генерацию закрепляют лицо персонажа, товар или локацию, а голосовой референс переносит в новую сцену ещё и тембр героя. Заодно появились генерация видео из текстового описания и нативное разрешение 1080p.

    Содержание

    1. Семь референсов на одну генерацию
    2. Голос держится вместе с лицом
    3. Видео из текста и 1080p
    4. Пока США и старшие подписки
    5. Реклама, ведущие, товарные ролики
    6. Veo и Runway пришли раньше
    7. Лицо и голос без согласия

    Grok Imagine — генератор изображений и видео от xAI, встроенный в Grok (Грок) и вынесенный отдельным разделом на grok.com. Обновление 31 июля компания подаёт как переход от разовых красивых роликов к съёмке сериями, где персонаж и обстановка не меняются от кадра к кадру. Функции включаются постепенно, и часть из них пока заперта на верхних подписках.

    Семь референсов на одну генерацию

    Каждое изображение-референс в Grok Imagine закрепляет один элемент сцены — лицо, товар или локацию. Остальное меняется по промпту. Можно оставить героя и переставить его в другой интерьер, оставить интерьер и поменять героя, либо зафиксировать оба слоя и менять только действие. Предел — семь референсов на одну генерацию.

    Ролик теперь собирается из повторяющихся элементов. Раньше похожего результата добивались десятком попыток с одним и тем же промптом, и совпадение получалось случайным.

    Голос держится вместе с лицом

    Вторая новинка релиза — голосовой референс. В Grok Imagine загружаются два файла, фотография персонажа и образец его голоса, после чего в новых сценах сохраняются и внешность, и звучание. Повторяемость голоса оставалась слабым местом генеративного видео дольше, чем повторяемость картинки: лицо ещё как-то удавалось удержать, а тембр героя плавал от ролика к ролику.

    Видео из текста и 1080p

    Grok Imagine научился делать видео из одного текстового описания, стартовое изображение больше не нужно. Технически xAI связала собственную генерацию картинок с режимом image-to-video: модель сначала рисует кадр, потом его оживляет.

    Второе изменение — нативные 1080p для обоих режимов, и текстового, и картиночного. Текст-в-видео и высокое разрешение уже открыты всем на grok.com/imagine, в приложениях для iOS и Android.

    Пока США и старшие подписки

    Референсы изображений и голоса стартовали 31 июля только в США и только для SuperGrok Heavy и SuperGrok Plus, двух верхних тарифов. xAI обещает раскатить их на остальные уровни в течение нескольких дней. Разработчикам изображения-референсы, генерация из текста и 1080p доступны в API под моделью grok-imagine-video-1.5; голосовой референс там выдают по отдельному запросу через отдел продаж.

    Последняя деталь говорит сама за себя. Перенос голоса xAI пока не готова отдавать в самообслуживание.

    Реклама, ведущие, товарные ролики

    Набор референсов переводит Grok Imagine в разряд рабочих инструментов для задач, где картинка обязана повторяться. Первыми открываются несколько сценариев:

    • рекламная серия, где товар выглядит одинаково во всех кадрах;
    • виртуальный ведущий с закреплённым лицом и голосом;
    • короткие скетчи и сериалы с постоянными персонажами;
    • демонстрация одного продукта в разных обстановках и ракурсах.

    Veo и Runway пришли раньше

    Сама идея опорных изображений на рынке не первый год. У Google в Veo работает режим Ingredients to Video, Runway с четвёртого поколения строит консистентность персонажей на референсах, Kling держит лицо через отдельную модель головы. Аргумент Grok Imagine — объём: семь опорных изображений против трёх у Veo, плюс голос, которого в связке «лицо и сцена» у конкурентов нет. Насколько уверенно это держится на длинных сценах, покажут ролики пользователей, а не демо на сайте xAI.

    Лицо и голос без согласия

    Связка «портрет плюс образец голоса» — ровно та функциональность, из которой делают дипфейки, и у Grok Imagine уже есть репутационный шлейф после историй с генерацией изображений реальных людей. Придержать голосовые референсы за формой обращения к продажам выглядит осознанной страховкой. Публичная часть продукта при этом принимает загруженные фотографии без такой оговорки. Проверочная точка близко: когда референсы раскатят на все тарифы и за пределы США, станет видно, справляются ли фильтры xAI с потоком портретов живых людей.



    Источник

    05.09.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Новости

    Voice AI преображает мир стриминга с помощью клонирования голоса

    admin 05.09.2026
    05.09.2026

    Voice AI представляет технологию клонирования голоса в реальном времени, революционизируя мир стриминга и гейминга. Эта инновация позволяет пользователям выбирать из …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Google отключила функцию ИИ-редактирования спутниковых снимков в Google Earth

    admin 05.09.2026
    05.09.2026

    Google отключила функцию Google Earth, которая позволяла пользователям редактировать спутниковые снимки с помощью текстовых запросов и ИИ. По сути, инструмент …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    OpenAI обнаружила новые побеги ИИ-агентов из тестовых «песочниц»

    admin 05.09.2026
    05.09.2026

    Широкий резонанс вызвал недавний случай, когда один из агентов OpenAI сумел выбраться из изолированной тестовой среды, а затем атаковал платформу для …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Higgsfield AI vs Runway vs Sora: Сравнение инструментов для генерации видео

    admin 05.09.2026
    05.09.2026

    Higgsfield AI vs Runway vs Sora — три мощных инструмента на базе искусственного интеллекта, которые трансформируют процесс создания видео. Каждый …

    0 VKOdnoklassnikiEmail
  • Новости

    Тейлор Свифт пытается защититься от ИИ-двойников через товарные знаки на фразы и сценическое фото

    admin 05.09.2026
    05.09.2026

    Тейлор Свифт годами сталкивается с ИИ-дипфейками и теперь пытается защититься от «двойников» через товарные знаки — хотя это может сработать …

    0 VKOdnoklassnikiEmail
  • Генерация текста

    ChatGPT теперь «видит» ваши действия на ПК — OpenAI представила Computer History

    admin 04.09.2026
    04.09.2026

    OpenAI представила Computer History — функцию, которая сохраняет недавние действия в приложениях и на сайтах в виде ленты и локальных …

    0 VKOdnoklassnikiEmail
  • Генерация видео

    MiniMax выпустила видеомодель H3 — ролики в 2K со звуком

    admin 04.09.2026
    04.09.2026

    MiniMax 31 июля представила H3 — мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики до 15 …

    0 VKOdnoklassnikiEmail
  • Новости

    Великобритания и США опубликовали первые глобальные рекомендации по безопасности ИИ

    admin 04.09.2026
    04.09.2026

    Национальный центр кибербезопасности Великобритании совместно с Агентством кибербезопасности и инфраструктурной безопасности США разработали первые в мире рекомендации по кибербезопасности для …

    0 VKOdnoklassnikiEmail
  • Новости

    Google TV станет умнее: новые возможности Gemini скоро появятся в вашем телевизоре

    admin 04.09.2026
    04.09.2026

    Google в среду объявила о новой волне функций на базе ИИ для Google TV, а также о специальной ленте коротких …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • Microsoft сократила около 4 800 сотрудников на фоне масштабной реструктуризации Xbox
  • Discord признал, что из-за бага в ИИ-системе модерации были ошибочно забанены тысячи пользователей
  • Anthropic представила Claude Design — новый продукт для быстрого создания визуалов
  • СМИ требуют санкций против OpenAI за сокрытие доказательств по делу об авторских правах
  • ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • Microsoft сократила около 4 800 сотрудников на фоне масштабной реструктуризации Xbox

    17.09.2026
  • Discord признал, что из-за бага в ИИ-системе модерации были ошибочно забанены тысячи пользователей

    17.09.2026
  • Anthropic представила Claude Design — новый продукт для быстрого создания визуалов

    17.09.2026
  • СМИ требуют санкций против OpenAI за сокрытие доказательств по делу об авторских правах

    16.09.2026
  • ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP

    16.09.2026
  • Google Bard теперь отвечает в реальном времени и позволяет прервать ответ на полуслове

    15.09.2026

Рубрики

  • Генерация видео (108)
  • Генерация звука (23)
  • Генерация изображений (88)
  • Генерация текста (68)
  • Новости (73)
  • Обзор сервисов (49)

Microsoft сократила около 4 800 сотрудников на фоне...

17.09.2026

Discord признал, что из-за бага в ИИ-системе модерации...

17.09.2026

Anthropic представила Claude Design — новый продукт для...

17.09.2026

СМИ требуют санкций против OpenAI за сокрытие доказательств...

16.09.2026

ElevenLabs добавила генерацию речи, музыки, изображений и видео...

16.09.2026

@2026 - smartaiblog.ru


Наверх
Блог об умном ИИ
  • Новости
  • Генерация видео
  • Генерация изображений
Блог об умном ИИ
  • Генерация звука
  • Генерация текста
  • Обзор сервисов