Files

5.5 KiB
Raw Permalink Blame History

P06. SuperBench: упреждающая проверка вычислительной инфраструктуры

  • Версия и дата проверки: 1.1, 07.09.2026.
  • Статус: готово к назначению.

Статья и исходные материалы

  • Основная статья: Yifan Xiong и соавт. — SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation. USENIX ATC 2024, Best Paper.
  • Кратко о статье: В крупных кластерах для задач ИИ отдельные компоненты могут деградировать, не вызывая явного отказа, но заметно замедляя распределённые задания. SuperBench объединяет направленные микротесты и проверки на разных этапах жизненного цикла инфраструктуры, чтобы заранее находить такие узлы и локализовать причину. В проекте строится доступный CPU-аналог этого подхода и сравниваются стратегии выбора проверок.
  • Почему результат актуален: SuperBench запускает короткие целевые тесты оборудования и коммуникаций до выдачи ресурсов ИИ-задачам, чтобы заранее исключать деградировавшие узлы из кластера.
  • Артефакты и данные: microsoft/superbenchmark с CPU- и GPU-тестами, профилями и документацией. Зафиксированные ревизии: microsoft/superbenchmark@2e2c52b80f4e (MIT).
  • Что уже предоставляет артефакт: SuperBench предоставляет тесты, конфигурации, сбор результатов и документацию для проверки инфраструктуры. CPU-тесты и средства их запуска можно использовать в собственном стенде.

Обязательный результат

  • Проверяемый вопрос или утверждение: набор направленных микротестов и обоснованный выбор их поднабора выявляют заданные виды скрытой деградации с меньшей стоимостью, чем неизбирательный запуск всех проверок.
  • Технический результат: Собрать CPU-набор проверок вычислений, памяти, диска и сети с управляемыми режимами деградации, единым сбором результатов и простым алгоритмом выбора поднабора тестов. Стенд должен автоматически подтверждать, что нормальный и деградированный режимы действительно различаются по заданным признакам.
  • Обязательное приращение команды: Создать управляемые режимы деградации вычислений, памяти, диска и сети, предусмотренную автоматическую проверку их проявления и простой алгоритм выбора поднабора тестов. Сопоставить диагностическую полезность тестов и результат отбора на собственных повторяемых сериях.
  • Эксперимент: на CPU построить несколько воспроизводимых режимов деградации, сравнить отдельные тесты и проверить простой алгоритм выбора поднабора проверок; при временном доступе к одной GPU можно добавить отдельную необязательную серию.
  • Границы выводов: стенд проверяет различимость заданных CPU-, memory-, disk- и network-деградаций и качество отбора тестов; он не подтверждает диагностику GPU-сбоев или предсказание отказов крупного производственного кластера.
  • Ресурсный профиль: локально, CPU, сеть, диск и 8–16 ГБ памяти; GPU не требуется. Обязательная часть проверяет сам механизм отбора и не переносит выводы на крупный AI-кластер.

Содержательные направления

  • сценарии деградации.
  • интеграция тестов и сбор метрик.
  • алгоритм выбора и оценка качества обнаружения.

Возможное продолжение

Учитывать стоимость ложных тревог и пропусков, добавить дрейф производительности или сравнить статический и адаптивный графики проверок.