Пример из видео
Я играю роль спикера на конференции.
Загружаю тезисы выступления → ИИ генерирует вопросы → ИИ-персонажи задают их «из зала» → в конце ИИ дает обратную связь.
Самый простой способ реализации диалогового тренажера с ИИ – сделать его в формате чата. Это просто, бюджетно, понятно и эффективно.
Но есть две зоны роста:
1. Совершенно точно можно еще поработать над вовлечением.
Да, вовлечение, геймификация и прочая развлекаловка – не обязательная задача обучения. Не обязательная, но и не лишняя.
2. Не все можно передать словами.
ИИ пока плохо справляется с передачей эмоций через голос. Да, многие модели пытаются, но, пока получается в лучшем случае на четверочку.
Так же, в текстовом диалоге не всегда понятно, что именно сейчас делает собеседник. Конечно, мы можем помимо прямой речи собеседника добавлять текстовые вставки: «клиент подошел чуть ближе» или «клиент взял товар в руки и с интересом его рассматривает».
Это улучшает понимание ситуации, но убивает иммерсивность.
Есть много способов «оживить» ИИ-персонажа. Писал о них тут.
К списку добавлю еще один подход – заранее сгенерированные ИИ-видео.
Как это работает?
1. Генерируем необходимые кусочки ИИ-видео, где собеседник что-то делает. Например, говорит, смотрит товар, ждет ответа и т.д. (видео из примера сгенерированы в Grok).
2. В зависимости от ситуации запускаем нужный фрагмент видео. Какой фрагмент запустить – выбирает ИИ. Просто говорим, какие видео у нас есть – ИИ выберет самый подходящий.
3. Поверх видео запускаем сгенерированный ИИ голос. Если выбрать простой визуальный стиль (в следующий раз немного упрощу визуал) – непопадание в губы будет практически незаметным, а «стыки» между видео не видны (а еще, никто не запрещает менять план и ракурс, так даже динамичнее).
Вот и все.
Конечно, чтобы это сработало качественно в диалоговом тренажере, таких фрагментов должно быть штук 50, чтобы под каждую ситуацию и под каждое настроение клиента нашелся подходящий кусочек.
За день, скорее всего с генерацией не управишься (именно поэтому, для демо я взял кейс попроще, но механику с выбором проверил на коленке – все работает как часы), но большую часть фрагментов, мы скорее всего сможем переиспользовать в дальнейшем. Так что в перспективе нескольких разработок – трудозатраты на визуализацию не сказать, что принципиально повлияют на Time-to-Market.
Понятно, что в обозримом будущем мы сможем на ходу генерировать любые видео, при этом с реалистичными персонажами в отличном качестве, что увеличит иммерсивность. Но, такой подход в любом случае будет весьма недешевым, а само будущее наступит когда-то, а работать с вовлечением мы хотим прямо сейчас.
Как итог:
Получается довольно интересный компромисс: персонаж ощущается живым, производство остается относительно дешевым, никаких затрат на токены, а трудозатраты — вполне подъемными даже для небольших команд.
——
Полную статью с советами по посещению конференций можно прочитать тут.
⭐️ Хотите заявить о себе? Обязательно участвуйте в Премии Digital Learning 2026! Ждем ваши заявки на сайте: https://dlmeeting.online/award