От инженера слышу с Валерием Новицким - Как мы ускоряем работу LLM

12+
12+

4 часа назад

ПожаловатьсяНарушение авторских прав
12+
12+

4 часа назад

ПожаловатьсяНарушение авторских прав
12+
12+

4 часа назад

«От инженера слышу» — подкаст, в котором мы говорим с инженерами о современной бэкенд-разработке, новых технологиях и самых сложных инженерных задачах. 3 октября пройдет Я про бэкенд — поговорим про бэкенд-разработку в эпоху AI. Регистрация по ссылке https://events.yandex.ru/events/yaprobackend#event-program Почему мощная видеокарта не гарантирует быстрый ответ нейросети? И как обслуживать больше запросов на том же железе, не заставляя пользователей ждать? В первом выпуске разбираемся, что происходит между отправкой запроса и появлением ответа. Обсуждаем, как устроен инференс больших языковых моделей и что помогает сделать его быстрее и дешевле: — чем обработка контекста отличается от генерации токенов; — как KV-кэш, квантование и спекулятивное декодирование помогают выжать больше из GPU; — как обрабатывать большой запрос одного пользователя, не тормозя остальных; — почему удачная оптимизация может оказаться бесполезной для конкретной нагрузки. А ещё поговорили про то, когда стоит разрабатывать свою библиотеку инференса и какую часть работы уже можно доверить AI-агентам. 0:00:00 – Вступление 0:00:36 – Чем занимается команда 0:02:06 – Метрики оптимизации 0:03:46 – Особенности инференса 0:07:11 – Дисбаланс между вычислительной мощностью и памятью 0:11:36 – Что такое attention 0:14:23 – Польза добавления дополнительных голов 0:18:15 – Спекулятивное вычисление 0:24:55 – Инновации DeepSeek 0:30:17 – Архитектура нейросетей 0:32:25 – Дистилляция 0:33:20 – Квантование 0:38:40 – Профилирование 0:40:33 – Экономия на оптимизации 0:42:30 – Проблемы с ЦПУ 0:45:24 – Классификация оптимизаций 0:48:42 – Сравнение с open source 0:50:00 – Почему не стоит править open source 0:51:50 – Будущее оптимизаций 0:54:15 – Неудачные оптимизации 0:59:25 – Агенты в оптимизации 1:04:50 – Заключение

Название:

От инженера слышу с Валерием Новицким - Как мы ускоряем работу LLM

Категория:

Разное