Files
nis2/project-tasks/p06-superbench.md
T

32 lines
5.5 KiB
Markdown
Raw Normal View History

2026-09-06 19:26:12 +03:00
# P06. SuperBench: упреждающая проверка вычислительной инфраструктуры
2026-09-07 21:46:04 +03:00
- **Версия и дата проверки:** 1.1, 07.09.2026.
2026-09-06 19:26:12 +03:00
- **Статус:** готово к назначению.
## Статья и исходные материалы
- **Основная статья:** Yifan Xiong и соавт. — [SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation](https://www.usenix.org/system/files/atc24-xiong.pdf). USENIX ATC 2024, Best Paper.
- **Кратко о статье:** В крупных кластерах для задач ИИ отдельные компоненты могут деградировать, не вызывая явного отказа, но заметно замедляя распределённые задания. SuperBench объединяет направленные микротесты и проверки на разных этапах жизненного цикла инфраструктуры, чтобы заранее находить такие узлы и локализовать причину. В проекте строится доступный CPU-аналог этого подхода и сравниваются стратегии выбора проверок.
- **Почему результат актуален:** SuperBench запускает короткие целевые тесты оборудования и коммуникаций до выдачи ресурсов ИИ-задачам, чтобы заранее исключать деградировавшие узлы из кластера.
- **Артефакты и данные:** [microsoft/superbenchmark](https://github.com/microsoft/superbenchmark) с CPU- и GPU-тестами, профилями и документацией. Зафиксированные ревизии: `microsoft/superbenchmark@2e2c52b80f4e` (MIT).
2026-09-07 21:46:04 +03:00
- **Что уже предоставляет артефакт:** SuperBench предоставляет тесты, конфигурации, сбор результатов и документацию для проверки инфраструктуры. CPU-тесты и средства их запуска можно использовать в собственном стенде.
2026-09-06 19:26:12 +03:00
## Обязательный результат
- **Проверяемый вопрос или утверждение:** набор направленных микротестов и обоснованный выбор их поднабора выявляют заданные виды скрытой деградации с меньшей стоимостью, чем неизбирательный запуск всех проверок.
- **Технический результат:** Собрать CPU-набор проверок вычислений, памяти, диска и сети с управляемыми режимами деградации, единым сбором результатов и простым алгоритмом выбора поднабора тестов. Стенд должен автоматически подтверждать, что нормальный и деградированный режимы действительно различаются по заданным признакам.
2026-09-07 21:46:04 +03:00
- **Обязательное приращение команды:** Создать управляемые режимы деградации вычислений, памяти, диска и сети, предусмотренную автоматическую проверку их проявления и простой алгоритм выбора поднабора тестов. Сопоставить диагностическую полезность тестов и результат отбора на собственных повторяемых сериях.
2026-09-06 19:26:12 +03:00
- **Эксперимент:** на CPU построить несколько воспроизводимых режимов деградации, сравнить отдельные тесты и проверить простой алгоритм выбора поднабора проверок; при временном доступе к одной GPU можно добавить отдельную необязательную серию.
- **Границы выводов:** стенд проверяет различимость заданных CPU-, memory-, disk- и network-деградаций и качество отбора тестов; он не подтверждает диагностику GPU-сбоев или предсказание отказов крупного производственного кластера.
- **Ресурсный профиль:** локально, CPU, сеть, диск и 8–16 ГБ памяти; GPU не требуется. Обязательная часть проверяет сам механизм отбора и не переносит выводы на крупный AI-кластер.
## Содержательные направления
- сценарии деградации.
- интеграция тестов и сбор метрик.
- алгоритм выбора и оценка качества обнаружения.
## Возможное продолжение
Учитывать стоимость ложных тревог и пропусков, добавить дрейф производительности или сравнить статический и адаптивный графики проверок.