first commit
This commit is contained in:
@@ -0,0 +1,45 @@
|
||||
# 16. Efficient Memory Management for Large Language Model Serving with PagedAttention
|
||||
|
||||
[К списку семинаров](README.md) · [Общие правила](../seminars.md) · [Расписание](../schedule.md)
|
||||
|
||||
- **Дата:** 1 марта 2027 года, 18:10
|
||||
- **Статья:** [Efficient Memory Management for Large Language Model Serving with PagedAttention](https://arxiv.org/pdf/2309.06180)
|
||||
- **Центральный вопрос:** как страничная организация KV-кэша меняет использование памяти, пакетирование запросов и пропускную способность LLM-сервинга?
|
||||
|
||||
## Участники
|
||||
|
||||
| Роль | Участник |
|
||||
|---|---|
|
||||
| Автор 1 | — |
|
||||
| Автор 2 | — |
|
||||
| Автор 3 | — |
|
||||
| Рецензент | — |
|
||||
| Археолог 1 | — |
|
||||
| Археолог 2 | — |
|
||||
| Исследователь | — |
|
||||
| Практик | — |
|
||||
|
||||
## Маршрут чтения и акценты
|
||||
|
||||
По умолчанию основной текст читается полностью. Нужно отделить механизм PagedAttention от планировщика vLLM, понять причины фрагментации KV-кэша, а также проверить нагрузки, baselines, метрики и границы переноса результатов на современные модели и аппаратные платформы.
|
||||
|
||||
**Дополнительное чтение к подготовке:** пока не назначено.
|
||||
|
||||
## Выбранные дополнительные тезисы
|
||||
|
||||
| После блока | Автор тезиса | Формулировка |
|
||||
|---|---|---|
|
||||
| — | — | — |
|
||||
|
||||
## После семинара
|
||||
|
||||
- **Запись:** —
|
||||
- **Источники из обсуждения:** —
|
||||
- **Содержательные уточнения:** —
|
||||
|
||||
### Оценка статьи студентами
|
||||
|
||||
- **Ответов:** —; из них участников с ролями: —
|
||||
- **Полезность:** — из 5
|
||||
- **Сложность среди участников с ролями:** — из 5
|
||||
- **Оставить в программе:** — из — ответов «да» или «скорее да»
|
||||
Reference in New Issue
Block a user