4.4 KiB
4.4 KiB
P24. Llumnix: динамическое перепланирование LLM-запросов
- Версия и дата проверки: 1.0, 05.09.2026.
- Статус: готово к назначению.
Статья и исходные материалы
- Основная статья: Biao Sun и соавт. — Llumnix: Dynamic Scheduling for Large Language Model Serving. OSDI 2024.
- Кратко о статье: При одноразовом назначении LLM-запросов экземплярам со временем возникают дисбаланс очередей и фрагментация KV-кэша, а приоритетные запросы могут ждать за длинными. Llumnix переносит выполняющийся запрос вместе с его KV-состоянием и использует миграцию для балансировки, дефрагментации и соблюдения приоритетов. В проекте проверяется, когда выигрыш от перепланирования превышает стоимость переноса.
- Почему результат актуален: Llumnix переносит активные LLM-запросы и их KV-состояние между экземплярами, чтобы динамически исправлять дисбаланс нагрузки и фрагментацию памяти.
- Артефакты и данные: llumnix-project/llumnix-ray; исследовательская ветка содержит сценарии основных экспериментов. Зафиксированная ревизия:
llumnix-project/llumnix-ray@3fb6c0376b3b(Apache-2.0).
Обязательный результат
- Проверяемый вопрос или утверждение: перенос активного запроса вместе с KV-состоянием позволяет выравнивать загрузку, устранять фрагментацию и поддерживать приоритеты лучше одноразового назначения.
- Технический результат: Построить дискретно-событийный симулятор нескольких экземпляров с профилями запросов, очередями, стоимостью миграции и тремя политиками: статическое назначение, least-loaded и перепланирование Llumnix. Добавить проверки сохранения запросов и согласованности учёта времени и очередей.
- Эксперимент: в симуляторе сравнить статическое назначение, least-loaded и перепланирование Llumnix при неоднородных длинах и интенсивности запросов по времени ожидания, нарушению SLO, использованию памяти и числу миграций.
- Границы выводов: выводы относятся к очередям, профилям и стоимости миграции, заданным в симуляторе; без GPU-стенда они не подтверждают фактическую цену переноса KV-кэша и соблюдение SLO в реальном LLM-сервисе.
- Ресурсный профиль: имитация, CPU и 4–8 ГБ памяти; полное авторское воспроизведение требует 16 GPU, поэтому обязательная часть проверяет алгоритмический механизм и калибрует стоимость по опубликованным данным.
Содержательные направления
- симулятор исполнения.
- политики и миграция.
- нагрузка, SLO-метрики и анализ устойчивости.
Возможное продолжение
Учесть стоимость миграции, ошибку прогноза длины, разные SLO или автоподбор порога переноса.