Files
nis2/seminars/16-2027-03-01-pagedattention.md
T

46 lines
2.3 KiB
Markdown
Raw Normal View History

2026-09-06 19:26:12 +03:00
# 16. Efficient Memory Management for Large Language Model Serving with PagedAttention
[К списку семинаров](README.md) · [Общие правила](../seminars.md) · [Расписание](../schedule.md)
- **Дата:** 1 марта 2027 года, 18:10
- **Статья:** [Efficient Memory Management for Large Language Model Serving with PagedAttention](https://arxiv.org/pdf/2309.06180)
- **Центральный вопрос:** как страничная организация KV-кэша меняет использование памяти, пакетирование запросов и пропускную способность LLM-сервинга?
## Участники
| Роль | Участник |
|---|---|
| Автор 1 | — |
| Автор 2 | — |
| Автор 3 | — |
| Рецензент | — |
| Археолог 1 | — |
| Археолог 2 | — |
| Исследователь | — |
| Практик | — |
## Маршрут чтения и акценты
По умолчанию основной текст читается полностью. Нужно отделить механизм PagedAttention от планировщика vLLM, понять причины фрагментации KV-кэша, а также проверить нагрузки, baselines, метрики и границы переноса результатов на современные модели и аппаратные платформы.
**Дополнительное чтение к подготовке:** пока не назначено.
## Выбранные дополнительные тезисы
| После блока | Автор тезиса | Формулировка |
|---|---|---|
| — | — | — |
## После семинара
- **Запись:** —
- **Источники из обсуждения:** —
- **Содержательные уточнения:** —
### Оценка статьи студентами
- **Ответов:** —; из них участников с ролями: —
- **Полезность:** — из 5
- **Сложность среди участников с ролями:** — из 5
- **Оставить в программе:** — из — ответов «да» или «скорее да»