Files
nis2/seminars/16-2027-03-01-pagedattention.md
2026-09-06 19:26:12 +03:00

46 lines
2.3 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 16. Efficient Memory Management for Large Language Model Serving with PagedAttention
[К списку семинаров](README.md) · [Общие правила](../seminars.md) · [Расписание](../schedule.md)
- **Дата:** 1 марта 2027 года, 18:10
- **Статья:** [Efficient Memory Management for Large Language Model Serving with PagedAttention](https://arxiv.org/pdf/2309.06180)
- **Центральный вопрос:** как страничная организация KV-кэша меняет использование памяти, пакетирование запросов и пропускную способность LLM-сервинга?
## Участники
| Роль | Участник |
|---|---|
| Автор 1 | — |
| Автор 2 | — |
| Автор 3 | — |
| Рецензент | — |
| Археолог 1 | — |
| Археолог 2 | — |
| Исследователь | — |
| Практик | — |
## Маршрут чтения и акценты
По умолчанию основной текст читается полностью. Нужно отделить механизм PagedAttention от планировщика vLLM, понять причины фрагментации KV-кэша, а также проверить нагрузки, baselines, метрики и границы переноса результатов на современные модели и аппаратные платформы.
**Дополнительное чтение к подготовке:** пока не назначено.
## Выбранные дополнительные тезисы
| После блока | Автор тезиса | Формулировка |
|---|---|---|
| — | — | — |
## После семинара
- **Запись:** —
- **Источники из обсуждения:** —
- **Содержательные уточнения:** —
### Оценка статьи студентами
- **Ответов:** —; из них участников с ролями: —
- **Полезность:** — из 5
- **Сложность среди участников с ролями:** — из 5
- **Оставить в программе:** — из — ответов «да» или «скорее да»