К содержанию

Разбор

Yandex AI Studio Series: 7 часов вебинаров, и почти всё ценное — не про модель

С 16 по 30 июля Яндекс провёл летнюю серию вебинаров для разработчиков: четыре технических встречи и фестивальный день с двумя клиентскими кейсами. Продуктовая часть — обычный вендорский апдейт. А вот два доклада от людей, которые довели ИИ-продукт до прода, стоят всех остальных шести часов вместе взятых.

Ниже — мой разбор, а под ним портал со всеми материалами: конспекты с тайм-кодами, 153 слайдов презентаций и сквозной поиск по всем пяти встречам.

Записей в серии

5

с 16 по 30 июля 2026

Суммарная длительность

6:38

часов расшифровано и сверено

Слайдов в презентациях

153

у фестивального дня презентаций нет

Прод-кейсов с цифрами

2

Domiland и СтройЭнергоКом

Сквозная тема: модель — это меньшая часть работы

Через все пять записей проходит один тезис, и его независимо друг от друга произносят продуктовая команда Яндекса, руководитель продукта из проптеха и разработчик контакт-центра. Звучит он так: агент — это не «LLM плюс инструменты». Модель нужна, чтобы понять запрос и выбрать действие. Всё остальное в чувствительных сценариях у модели надо забрать.

Прототип на AI Studio поднимается за пару дней. Дальше 90% времени уходит на то, что вокруг него.

Из этого вырастают четыре практических правила, которые в серии повторяются в разных формулировках:

  • Критичные проверки живут в коде, а не в промпте. Обе продуктовые команды пришли к собственному циклу вызова функций поверх API — ради контроля порядка вызовов, авторизации и обязательного подтверждения от пользователя. Гардрейлы в системном промпте, по прямой оценке Domiland, «работают абсолютно никак».
  • Больше 10–15 инструментов на агента — уже перебор. Дальше роутинг разваливается, и нужен либо классификатор перед агентами, либо мультиагентная схема с передачей диалога.
  • Контекст — главный дефицитный ресурс. Не длина окна, а то, что в него попало и в каком порядке.
  • Без эвалов прода не будет. Причём инфраструктуру прогонов надо строить не после пилота, а до него.

Два кейса, ради которых стоит смотреть

Domiland — проптех-направление Яндекса, приложение для жителей многоквартирных домов. Ассистент принимает показания счётчиков (в том числе по фотографии, до четырёх фото сразу), заводит заявки в управляющую компанию, отвечает про отключения воды. Сейчас в проде: более 20 тысяч жителей пользуются регулярно, примерно 15% обращений в адрес управляющих компаний ассистент перехватывает на себя. Собрано за 2 месяца календарно, без выделенной команды разработки.

Интересно не это, а список того, что пришлось построить после того, как пилот заработал: отдельный контур авторизации мимо модели, валидационные корзины с LLM-судьёй, инъекция идентификатора квартиры прямо в контекст, шаблонизация ответов об операциях записи в коде, явное описание запретов в тулах и собственный цикл вызова функций. Отдельная деталь, которую стоит забрать себе: контекст, вложенный в ответ инструмента, считывается моделью лучше, чем тот же текст в системном промпте.

Второй кейс — контакт-центр компании, которая ставит приборы учёта в 18 регионах. До внедрения: внештатный колл-центр из 15 операторов, потеря около 20% входящего трафика в пики, невозможность работать больше 12 часов в сутки. После: с июня 2026 система полностью в проде, 0% непринятых входящих, режим 24/7, себестоимость упала более чем в 3 раза. По железу — до 70 параллельных диалогов и до 3000 звонков в час на одном экземпляре, утилизация в пик не выше 10%.

Здесь самая плотная часть — про то, как писать промпт для голосового агента. Markdown не сработал, XML сработал лучше, а взлетел кастомный DSL внутри XML, описывающий диалог как state machine. Осмысленные имена этапов оказались антипаттерном: если этап называется так же, как инструмент, модель пытается вызвать кусок текста вместо функции — пришлось перейти на случайные последовательности букв. Пауза перед ответом: дефолтные 0,5 секунды заменили на 1,6 по результатам A/B, потому что «так быстро никто не думает и не говорит».

И мой любимый фрагмент всей серии: агенты прекрасно общаются с агентами. Команда несколько дней жгла токены на болтовню своего робота с чужими автоответчиками, пока не поставила в первые секунды звонка дешёвый промпт-классификатор «человек или ассистент».

Мастер-класс, который спорит с маркетингом

Заключительный доклад читал архитектор Yandex Cloud, и в нём есть цифра, которую полезно знать всем, кто верит в заявленные размеры контекстных окон. Внимание модели распределено U-образно: высокое в начале и в конце, провал в середине. Эффективно работает 30–40% окна — для заявленных 250 тысяч токенов это примерно 100 тысяч, дальше начинаются потери. В провале посередине остаётся около 10% внимания.

Оттуда же — пирамида памяти (краткосрочный контекст, легко подгружаемое, долговременное хранилище), рекомендация держать в системном промпте 10–15 правил и не больше, и разделение инструментов по назначению: в векторный поиск идёт только текст, точечные данные по идентификатору — через вызов функции. Плюс нормальный разбор паттернов оркестрации: последовательная цепочка, мультиплексирование, групповой чат, делегирование и динамическая оркестрация.

Чего в серии нет

Честно про слабые места. Все цифры кейсов — со слов докладчиков, проверить их нельзя. Экономику в деньгах не показал никто: «себестоимость упала в 3 раза» и «сэкономили двух бэкендеров» — это оценки, а не отчёт. Сравнения качества моделей платформы с зарубежными аналогами нет вообще, что для вендорского мероприятия ожидаемо, но помнить об этом стоит.

Продуктовая часть местами буксует: половина заявленного — планы без сроков, а формулировки вида «скоро будет умнее» повторяются из вебинара в вебинар. Из конкретного и уже работающего: truncation для защиты от переполнения контекста, обновлённый мониторинг с трейсами, крупное обновление веб-поиска и запуск Codex поверх платформы через профиль в TOML и описание моделей в JSON.

Что обещают

НаправлениеЧто заявленоСтатус
Responses APIПоддержка Skills: создание и автоматическое использованиеБета по запросу
Responses APIОтправка файлов напрямую, без построения индексаБлижайшие планы
КонтекстУмное сжатие истории диалога сверх truncationПланы
ПоискПоиск сразу по нескольким векторным индексамПланы
ГолосАктивное слушание: модель реагирует на паузы абонентаВ разработке
ГолосTruncate API: вырезание непроговорённых токеновПоявился
НаблюдаемостьObservability в AI Studio, трейсы вызовов агентовПоявилась
ПрочееBatch-вызовы LLM в асинхронном режимеДоступно

Отдельный вебинар по Skills был анонсирован на 6 августа, следующая серия — на конец осени.

Как собран этот портал

Записи вебинаров расшифрованы локально через whisper.cpp (модель large-v3-turbo). Конспекты собраны по субтитрам и затем сверены с презентациями спикеров: точные имена параметров API, листинги и схемы взяты со слайдов, расхождения между речью и слайдом помечены сносками. Тайм-коды в конспектах соответствуют записям.

Распознавание автоматическое, поэтому неподтверждённые места помечены знаком вопроса в скобках — в основном это версии моделей из живых демо, которых нет на слайдах. Конспект фестивального дня собран только по расшифровке: презентаций к нему нет, а первые 16 минут записи — тишина, звук начинается уже в середине фразы.

Материалы принадлежат Яндексу и опубликованы здесь как справочник к открытым вебинарам. Ниже — портал: выбирайте встречу в списке слева, переключайтесь между конспектом и слайдами, ищите по всем пяти сразу. У каждой встречи можно скачать полную расшифровку в SRT — с теми же тайм-кодами, что в конспекте.