Files
nis2/seminars/16-2027-03-01-pagedattention.md
2026-09-06 19:26:12 +03:00

2.3 KiB
Raw Permalink Blame History

16. Efficient Memory Management for Large Language Model Serving with PagedAttention

К списку семинаров · Общие правила · Расписание

  • Дата: 1 марта 2027 года, 18:10
  • Статья: Efficient Memory Management for Large Language Model Serving with PagedAttention
  • Центральный вопрос: как страничная организация KV-кэша меняет использование памяти, пакетирование запросов и пропускную способность LLM-сервинга?

Участники

Роль Участник
Автор 1
Автор 2
Автор 3
Рецензент
Археолог 1
Археолог 2
Исследователь
Практик

Маршрут чтения и акценты

По умолчанию основной текст читается полностью. Нужно отделить механизм PagedAttention от планировщика vLLM, понять причины фрагментации KV-кэша, а также проверить нагрузки, baselines, метрики и границы переноса результатов на современные модели и аппаратные платформы.

Дополнительное чтение к подготовке: пока не назначено.

Выбранные дополнительные тезисы

После блока Автор тезиса Формулировка

После семинара

  • Запись:
  • Источники из обсуждения:
  • Содержательные уточнения:

Оценка статьи студентами

  • Ответов: —; из них участников с ролями: —
  • Полезность: — из 5
  • Сложность среди участников с ролями: — из 5
  • Оставить в программе: — из — ответов «да» или «скорее да»