# 17. MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs [К списку семинаров](README.md) · [Общие правила](../seminars.md) · [Расписание](../schedule.md) - **Дата:** 9 марта 2027 года, 18:10 - **Статья:** [MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs](https://www.usenix.org/system/files/nsdi24-jiang-ziheng.pdf) - **Центральный вопрос:** какие системные механизмы делают обучение больших моделей эффективным и устойчивым на более чем десяти тысячах GPU? ## Участники | Роль | Участник | |---|---| | Автор 1 | — | | Автор 2 | — | | Автор 3 | — | | Рецензент | — | | Археолог 1 | — | | Археолог 2 | — | | Исследователь | — | | Практик | — | ## Маршрут чтения и акценты По умолчанию основной текст читается полностью. Следует связать параллелизм, коммуникации, планирование и обработку отказов с измеренной эффективностью, затем отделить общие принципы от решений, доступных только оператору инфраструктуры такого масштаба. **Дополнительное чтение к подготовке:** пока не назначено. ## Выбранные дополнительные тезисы | После блока | Автор тезиса | Формулировка | |---|---|---| | — | — | — | ## После семинара - **Запись:** — - **Источники из обсуждения:** — - **Содержательные уточнения:** — ### Оценка статьи студентами - **Ответов:** —; из них участников с ролями: — - **Полезность:** — из 5 - **Сложность среди участников с ролями:** — из 5 - **Оставить в программе:** — из — ответов «да» или «скорее да»