46 lines
2.3 KiB
Markdown
46 lines
2.3 KiB
Markdown
# 16. Efficient Memory Management for Large Language Model Serving with PagedAttention
|
||
|
||
[К списку семинаров](README.md) · [Общие правила](../seminars.md) · [Расписание](../schedule.md)
|
||
|
||
- **Дата:** 1 марта 2027 года, 18:10
|
||
- **Статья:** [Efficient Memory Management for Large Language Model Serving with PagedAttention](https://arxiv.org/pdf/2309.06180)
|
||
- **Центральный вопрос:** как страничная организация KV-кэша меняет использование памяти, пакетирование запросов и пропускную способность LLM-сервинга?
|
||
|
||
## Участники
|
||
|
||
| Роль | Участник |
|
||
|---|---|
|
||
| Автор 1 | — |
|
||
| Автор 2 | — |
|
||
| Автор 3 | — |
|
||
| Рецензент | — |
|
||
| Археолог 1 | — |
|
||
| Археолог 2 | — |
|
||
| Исследователь | — |
|
||
| Практик | — |
|
||
|
||
## Маршрут чтения и акценты
|
||
|
||
По умолчанию основной текст читается полностью. Нужно отделить механизм PagedAttention от планировщика vLLM, понять причины фрагментации KV-кэша, а также проверить нагрузки, baselines, метрики и границы переноса результатов на современные модели и аппаратные платформы.
|
||
|
||
**Дополнительное чтение к подготовке:** пока не назначено.
|
||
|
||
## Выбранные дополнительные тезисы
|
||
|
||
| После блока | Автор тезиса | Формулировка |
|
||
|---|---|---|
|
||
| — | — | — |
|
||
|
||
## После семинара
|
||
|
||
- **Запись:** —
|
||
- **Источники из обсуждения:** —
|
||
- **Содержательные уточнения:** —
|
||
|
||
### Оценка статьи студентами
|
||
|
||
- **Ответов:** —; из них участников с ролями: —
|
||
- **Полезность:** — из 5
|
||
- **Сложность среди участников с ролями:** — из 5
|
||
- **Оставить в программе:** — из — ответов «да» или «скорее да»
|