Алексей Горбунов.Работа с ML моделями в условиях высоких нагрузок на примере Triton Inference Server

14 подписчиков

12+
12+

3 просмотра

17 дней назад

ПожаловатьсяНарушение авторских прав

14 подписчиков

12+
12+

3 просмотра

17 дней назад

ПожаловатьсяНарушение авторских прав
12+
12+

3 просмотра

17 дней назад

DUMP SPb 2025 - 14 февраля, dump-spb.ru DUMP Ekb 2025 - 25 апреля, dump-ekb.ru Организация работы с ML моделями в условиях высоких нагрузок на примере Triton Inference Server Алексей Горбунов Старший разработчик информационных систем, Ozon Чтобы ML-решения начали приносить ценность, их требуется интегрировать в существующие процессы, при этом обеспечив не только прозрачность для клиентов, но и способность выдерживать высокие нагрузки. И в этот момент открывается целый мир возможных инструментов и задач, которые предстоит решить. В этом докладе рассмотрим следующие вопросы, с которыми нам пришлось столкнуться во время решения задачи интеграции ML-моделей в продакшн: Обзор существующих решений для инфера моделей и доставки их в прод Распределение ресурсов, как расселить множество моделей, и обязательно ли нужны GPU Мониторинг и всё, что необходимо для поддержания стабильности вашей системы для инфера Автоматизация доставки моделей: как ускорить и упростить процесс, не жертвуя отказоустойчивостью

Название:

Алексей Горбунов.Работа с ML моделями в условиях высоких нагрузок на примере Triton Inference Server

Категория:

Разное