Files

5.3 KiB
Raw Permalink Blame History

P24. Llumnix: динамическое перепланирование LLM-запросов

  • Версия и дата проверки: 1.1, 07.09.2026.
  • Статус: готово к назначению.

Статья и исходные материалы

  • Основная статья: Biao Sun и соавт. — Llumnix: Dynamic Scheduling for Large Language Model Serving. OSDI 2024.
  • Кратко о статье: При одноразовом назначении LLM-запросов экземплярам со временем возникают дисбаланс очередей и фрагментация KV-кэша, а приоритетные запросы могут ждать за длинными. Llumnix переносит выполняющийся запрос вместе с его KV-состоянием и использует миграцию для балансировки, дефрагментации и соблюдения приоритетов. В проекте проверяется, когда выигрыш от перепланирования превышает стоимость переноса.
  • Почему результат актуален: Llumnix переносит активные LLM-запросы и их KV-состояние между экземплярами, чтобы динамически исправлять дисбаланс нагрузки и фрагментацию памяти.
  • Артефакты и данные: llumnix-project/llumnix-ray; исследовательская ветка содержит сценарии основных экспериментов. Зафиксированная ревизия: llumnix-project/llumnix-ray@3fb6c0376b3b (Apache-2.0).
  • Что уже предоставляет артефакт: Llumnix содержит перепланирование, миграцию, benchmark-сценарии и режим симуляции на профилях. Эти материалы разрешено использовать как источник профилей и эталон поведения собственной CPU-модели.

Обязательный результат

  • Проверяемый вопрос или утверждение: перенос активного запроса вместе с KV-состоянием позволяет выравнивать загрузку, устранять фрагментацию и поддерживать приоритеты лучше одноразового назначения.
  • Технический результат: Построить дискретно-событийный симулятор нескольких экземпляров с профилями запросов, очередями, стоимостью миграции и тремя политиками: статическое назначение, least-loaded и перепланирование Llumnix. Добавить проверки сохранения запросов и согласованности учёта времени и очередей.
  • Обязательное приращение команды: Построить предусмотренную собственную дискретно-событийную модель очередей и миграции с тремя политиками, проверкой сохранения запросов и учёта времени. Сопоставить политики при неоднородных длинах и интенсивности; готовый режим симуляции служит проверке модели.
  • Эксперимент: в симуляторе сравнить статическое назначение, least-loaded и перепланирование Llumnix при неоднородных длинах и интенсивности запросов по времени ожидания, нарушению SLO, использованию памяти и числу миграций.
  • Границы выводов: выводы относятся к очередям, профилям и стоимости миграции, заданным в симуляторе; без GPU-стенда они не подтверждают фактическую цену переноса KV-кэша и соблюдение SLO в реальном LLM-сервисе.
  • Ресурсный профиль: имитация, CPU и 4–8 ГБ памяти; полное авторское воспроизведение требует 16 GPU, поэтому обязательная часть проверяет алгоритмический механизм и калибрует стоимость по опубликованным данным.

Содержательные направления

  • симулятор исполнения.
  • политики и миграция.
  • нагрузка, SLO-метрики и анализ устойчивости.

Возможное продолжение

Учесть стоимость миграции, ошибку прогноза длины, разные SLO или автоподбор порога переноса.