2.3 KiB
2.3 KiB
16. Efficient Memory Management for Large Language Model Serving with PagedAttention
К списку семинаров · Общие правила · Расписание
- Дата: 1 марта 2027 года, 18:10
- Статья: Efficient Memory Management for Large Language Model Serving with PagedAttention
- Центральный вопрос: как страничная организация KV-кэша меняет использование памяти, пакетирование запросов и пропускную способность LLM-сервинга?
Участники
| Роль | Участник |
|---|---|
| Автор 1 | — |
| Автор 2 | — |
| Автор 3 | — |
| Рецензент | — |
| Археолог 1 | — |
| Археолог 2 | — |
| Исследователь | — |
| Практик | — |
Маршрут чтения и акценты
По умолчанию основной текст читается полностью. Нужно отделить механизм PagedAttention от планировщика vLLM, понять причины фрагментации KV-кэша, а также проверить нагрузки, baselines, метрики и границы переноса результатов на современные модели и аппаратные платформы.
Дополнительное чтение к подготовке: пока не назначено.
Выбранные дополнительные тезисы
| После блока | Автор тезиса | Формулировка |
|---|---|---|
| — | — | — |
После семинара
- Запись: —
- Источники из обсуждения: —
- Содержательные уточнения: —
Оценка статьи студентами
- Ответов: —; из них участников с ролями: —
- Полезность: — из 5
- Сложность среди участников с ролями: — из 5
- Оставить в программе: — из — ответов «да» или «скорее да»