Коротко: Обучение и инференс больших моделей упираются не только в GPU, но и в сеть между ними. Объясняем компоненты AI-фабрики и что учитывать при сборке ИИ-кластера.
NVIDIA H100/H200 и платформы HGX/Supermicro на 4–8 GPU. Плотность, питание и охлаждение — ключевые ограничения. Подборка — GPU NVIDIA и GPU-платформы Supermicro.
Для межузлового обмена нужна сеть с низкой задержкой: InfiniBand (NVIDIA/Mellanox) или Ethernet с RoCE на 200/400G. От неё зависит масштабируемость обучения.
400G-фабрика — это QSFP-DD/OSFP-модули, DAC/AOC и коммутаторы высокой плотности. Совместимость портов критична — подберём комплект.
GPU-стойка потребляет десятки кВт — нужны мощные PDU, ИБП и часто жидкостное охлаждение. Заложите это в проект серверной заранее.
Смотреть gpu и ai-серверы в наличии →