# 16. Efficient Memory Management for Large Language Model Serving with PagedAttention [К списку семинаров](README.md) · [Общие правила](../seminars.md) · [Расписание](../schedule.md) - **Дата:** 1 марта 2027 года, 18:10 - **Статья:** [Efficient Memory Management for Large Language Model Serving with PagedAttention](https://arxiv.org/pdf/2309.06180) - **Центральный вопрос:** как страничная организация KV-кэша меняет использование памяти, пакетирование запросов и пропускную способность LLM-сервинга? ## Участники | Роль | Участник | |---|---| | Автор 1 | — | | Автор 2 | — | | Автор 3 | — | | Рецензент | — | | Археолог 1 | — | | Археолог 2 | — | | Исследователь | — | | Практик | — | ## Маршрут чтения и акценты По умолчанию основной текст читается полностью. Нужно отделить механизм PagedAttention от планировщика vLLM, понять причины фрагментации KV-кэша, а также проверить нагрузки, baselines, метрики и границы переноса результатов на современные модели и аппаратные платформы. **Дополнительное чтение к подготовке:** пока не назначено. ## Выбранные дополнительные тезисы | После блока | Автор тезиса | Формулировка | |---|---|---| | — | — | — | ## После семинара - **Запись:** — - **Источники из обсуждения:** — - **Содержательные уточнения:** — ### Оценка статьи студентами - **Ответов:** —; из них участников с ролями: — - **Полезность:** — из 5 - **Сложность среди участников с ролями:** — из 5 - **Оставить в программе:** — из — ответов «да» или «скорее да»