ITequipment.ruсетевое и серверное оборудование · МоскваПерейти в каталог →

Как выбрать GPU-сервер для ИИ

Коротко: GPU-сервер для ИИ подбирают от задачи: обучение крупных моделей, дообучение или инференс требуют разных ускорителей, памяти и охлаждения. Разберём, как выбрать GPU и платформу и на чём не стоит экономить.

Ускоритель под задачу

H100/H200 (Hopper) — для обучения и инференса больших LLM; H200 несёт 141 ГБ HBM3e против 80 ГБ у H100 и выгоднее там, где всё упирается в память. A100 (80/40 ГБ HBM2e) — проверенный ускоритель обучения и HPC с NVLink и MIG. L40S (48 ГБ GDDR6, Ada) — универсал для инференса, дообучения, графики и видео на PCIe. Для чистого обучения берут SXM-платформы (H100/H200/A100), для инференса и смешанных нагрузок — PCIe (L40S, A100 PCIe).

Форм-фактор: SXM или PCIe, NVLink

SXM — модули на плате HGX с быстрым NVLink/NVSwitch между GPU: максимальная связность для многокарточного обучения, но это цельная платформа (обычно 4–8 GPU) с высоким питанием и жидкостным или мощным воздушным охлаждением. PCIe — обычные карты в слотах, гибче и дешевле масштабируются по одной-две, NVLink-мост опционален. Если модель делится между многими GPU — нужен SXM с NVLink; если карты работают независимо (инференс) — достаточно PCIe.

Питание и охлаждение

Это то, на чём нельзя экономить: один H100 SXM потребляет до 700 Вт, узел из 8 GPU — несколько киловатт. Нужны блоки питания с запасом и резервированием, продуманный воздушный поток (высокооборотные вентиляторы, «горячий» и «холодный» коридоры) или жидкостное охлаждение, а также стойка и ИБП/PDU соответствующей мощности. Неверный расчёт питания и охлаждения — главная причина троттлинга и сбоев GPU-серверов.

CPU, память и сеть

Чтобы GPU не простаивали, платформу балансируют: достаточно ядер CPU и линий PCIe, много системной памяти (часто 512 ГБ–1 ТБ и выше), быстрые NVMe под датасеты и checkpoint. Для multi-node обучения критична сеть — 100/200/400G Ethernet или InfiniBand с RDMA. Экономия на CPU, RAM, дисках или сети превращает дорогие ускорители в узкое место.

Готовая сборка, новое и б/у

GPU-сервер удобнее брать собранным и протестированным целиком: платформа (Supermicro, Dell, HPE, Gigabyte), совместимые GPU, питание, охлаждение и сеть под вашу задачу. A100 и более ранние карты доступны в б/у с проверкой; H100/H200 — чаще новые и под заказ. Пришлите задачу (обучение или инференс, размер моделей, число узлов) — соберём конфигурацию и рассчитаем поставку.

Смотреть серверы в наличии →

Вопросы по теме

Какой GPU выбрать для обучения LLM?
Для обучения и инференса больших моделей — H100 или H200 (H200 при упоре в память). A100 остаётся отличным вариантом для обучения и HPC по цене вторичного рынка.
SXM или PCIe?
SXM с NVLink — для многокарточного обучения, где модель делится между GPU. PCIe (L40S, A100 PCIe) — для инференса и гибкого масштабирования по одной-две карты.
Что с питанием и охлаждением GPU-сервера?
Один H100 SXM — до 700 Вт, узел из 8 GPU — киловатты. Нужны БП с запасом, мощное воздушное или жидкостное охлаждение и стойка/ИБП соответствующей мощности.
Можно ли брать б/у ускорители?
A100 и более ранние карты доступны в б/у с проверкой на стенде. H100/H200 — обычно новые и под заказ.
Соберёте GPU-сервер под задачу?
Да, подберём платформу, GPU, питание, охлаждение и сеть, соберём и протестируем целиком. Пришлите задачу и размеры моделей — рассчитаем.