46 lines
2.3 KiB
Markdown
46 lines
2.3 KiB
Markdown
# 16. Efficient Memory Management for Large Language Model Serving with PagedAttention
|
||||
|
|
|
|||
|
|
[К списку семинаров](README.md) · [Общие правила](../seminars.md) · [Расписание](../schedule.md)
|
|||
|
|
|
|||
|
|
- **Дата:** 1 марта 2027 года, 18:10
|
|||
|
|
- **Статья:** [Efficient Memory Management for Large Language Model Serving with PagedAttention](https://arxiv.org/pdf/2309.06180)
|
|||
|
|
- **Центральный вопрос:** как страничная организация KV-кэша меняет использование памяти, пакетирование запросов и пропускную способность LLM-сервинга?
|
|||
|
|
|
|||
|
|
## Участники
|
|||
|
|
|
|||
|
|
| Роль | Участник |
|
|||
|
|
|---|---|
|
|||
|
|
| Автор 1 | — |
|
|||
|
|
| Автор 2 | — |
|
|||
|
|
| Автор 3 | — |
|
|||
|
|
| Рецензент | — |
|
|||
|
|
| Археолог 1 | — |
|
|||
|
|
| Археолог 2 | — |
|
|||
|
|
| Исследователь | — |
|
|||
|
|
| Практик | — |
|
|||
|
|
|
|||
|
|
## Маршрут чтения и акценты
|
|||
|
|
|
|||
|
|
По умолчанию основной текст читается полностью. Нужно отделить механизм PagedAttention от планировщика vLLM, понять причины фрагментации KV-кэша, а также проверить нагрузки, baselines, метрики и границы переноса результатов на современные модели и аппаратные платформы.
|
|||
|
|
|
|||
|
|
**Дополнительное чтение к подготовке:** пока не назначено.
|
|||
|
|
|
|||
|
|
## Выбранные дополнительные тезисы
|
|||
|
|
|
|||
|
|
| После блока | Автор тезиса | Формулировка |
|
|||
|
|
|---|---|---|
|
|||
|
|
| — | — | — |
|
|||
|
|
|
|||
|
|
## После семинара
|
|||
|
|
|
|||
|
|
- **Запись:** —
|
|||
|
|
- **Источники из обсуждения:** —
|
|||
|
|
- **Содержательные уточнения:** —
|
|||
|
|
|
|||
|
|
### Оценка статьи студентами
|
|||
|
|
|
|||
|
|
- **Ответов:** —; из них участников с ролями: —
|
|||
|
|
- **Полезность:** — из 5
|
|||
|
|
- **Сложность среди участников с ролями:** — из 5
|
|||
|
|
- **Оставить в программе:** — из — ответов «да» или «скорее да»
|