4.6 KiB
4.6 KiB
P06. SuperBench: упреждающая проверка вычислительной инфраструктуры
- Версия и дата проверки: 1.0, 05.09.2026.
- Статус: готово к назначению.
Статья и исходные материалы
- Основная статья: Yifan Xiong и соавт. — SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation. USENIX ATC 2024, Best Paper.
- Кратко о статье: В крупных кластерах для задач ИИ отдельные компоненты могут деградировать, не вызывая явного отказа, но заметно замедляя распределённые задания. SuperBench объединяет направленные микротесты и проверки на разных этапах жизненного цикла инфраструктуры, чтобы заранее находить такие узлы и локализовать причину. В проекте строится доступный CPU-аналог этого подхода и сравниваются стратегии выбора проверок.
- Почему результат актуален: SuperBench запускает короткие целевые тесты оборудования и коммуникаций до выдачи ресурсов ИИ-задачам, чтобы заранее исключать деградировавшие узлы из кластера.
- Артефакты и данные: microsoft/superbenchmark с CPU- и GPU-тестами, профилями и документацией. Зафиксированные ревизии:
microsoft/superbenchmark@2e2c52b80f4e(MIT).
Обязательный результат
- Проверяемый вопрос или утверждение: набор направленных микротестов и обоснованный выбор их поднабора выявляют заданные виды скрытой деградации с меньшей стоимостью, чем неизбирательный запуск всех проверок.
- Технический результат: Собрать CPU-набор проверок вычислений, памяти, диска и сети с управляемыми режимами деградации, единым сбором результатов и простым алгоритмом выбора поднабора тестов. Стенд должен автоматически подтверждать, что нормальный и деградированный режимы действительно различаются по заданным признакам.
- Эксперимент: на CPU построить несколько воспроизводимых режимов деградации, сравнить отдельные тесты и проверить простой алгоритм выбора поднабора проверок; при временном доступе к одной GPU можно добавить отдельную необязательную серию.
- Границы выводов: стенд проверяет различимость заданных CPU-, memory-, disk- и network-деградаций и качество отбора тестов; он не подтверждает диагностику GPU-сбоев или предсказание отказов крупного производственного кластера.
- Ресурсный профиль: локально, CPU, сеть, диск и 8–16 ГБ памяти; GPU не требуется. Обязательная часть проверяет сам механизм отбора и не переносит выводы на крупный AI-кластер.
Содержательные направления
- сценарии деградации.
- интеграция тестов и сбор метрик.
- алгоритм выбора и оценка качества обнаружения.
Возможное продолжение
Учитывать стоимость ложных тревог и пропусков, добавить дрейф производительности или сравнить статический и адаптивный графики проверок.