Коротко: Ускорители NVIDIA — фундамент современной инфраструктуры машинного обучения. Разница между моделями и форматами определяет, поместится ли ваша модель в память, как быстро пойдёт обучение и сколько карт удастся связать в один узел. Разберём поколения, форматы SXM/PCIe, роль памяти HBM и межкарточных связей, и как под ускоритель подобрать сервер и питание.
Зачем для ИИ отдельные ускорители
Обучение и инференс нейросетей — это массово-параллельные матричные вычисления, для которых GPU на порядки эффективнее CPU. Ключевые для ИИ характеристики ускорителя: производительность в форматах пониженной точности (FP16/BF16/FP8), объём и полоса памяти HBM, наличие тензорных ядер и скорость связи между картами. Именно память и межкарточные связи чаще всего ограничивают, какую модель вы сможете обучать.
Поколения NVIDIA для дата-центра
Ampere (A100) — предыдущее поколение, HBM2e 40/80 ГБ. Всё ещё массово используется, хорошее соотношение цена/возможности.
Hopper (H100, H200) — текущий стандарт для обучения больших языковых моделей. Transformer Engine, поддержка FP8, HBM3/HBM3e.
Ada Lovelace (L40S, L4) — универсальные PCIe-карты под инференс, графику, видео и лёгкое обучение.
Blackwell (B200, B100, GB200) — новейшее поколение под крупнейшие модели: резкий рост производительности и памяти, системы уровня стойки (GB200 NVL72).
Модели детально: A100, H100, H200, L40S, B200
A100 — 40 или 80 ГБ HBM2e, форматы SXM4 и PCIe; рабочая лошадка предыдущего цикла. H100 — 80 ГБ HBM3, Transformer Engine и FP8 кратно ускоряют обучение LLM; форматы SXM5 и PCIe. H200 — тот же вычислитель Hopper, но 141 ГБ HBM3e с большей полосой: заметно выгоднее для инференса крупных моделей, где всё упирается в память. L40S — 48 ГБ GDDR6, PCIe, отличный универсал для инференса и медиаобработки. B200 (Blackwell) — новое поколение с существенно большими памятью и пропускной способностью под фронтир-модели.
Формат SXM или PCIe
Это определяет мощность и связность:
SXM — модули устанавливаются на плату-носитель (baseboard) в платформах HGX/DGX. Максимальный теплопакет (до 700 Вт), полноскоростной NVLink между всеми GPU узла через NVSwitch. Это выбор для многокарточного обучения, где карты активно обмениваются данными.
PCIe — обычные карты в слот сервера, ниже теплопакет, NVLink опционально мостом между парой. Проще интегрировать и охлаждать; оптимальны для инференса и смешанных нагрузок.
Для тренинга больших моделей берут SXM-системы; для инференса и универсальных задач часто достаточно PCIe (H100 PCIe, L40S).
NVLink, NVSwitch и почему это важно
При обучении на многих GPU узким местом становится обмен данными между картами (all-reduce градиентов). Обычная PCIe для этого медленная. NVLink даёт прямые высокоскоростные линии между GPU, а NVSwitch связывает все карты узла на полной скорости «каждый с каждым». В SXM-платформах это встроено, что и делает их предпочтительными для масштабного тренинга. Для инференса одной-двух карт межкарточная связь менее критична.
Память HBM: сколько нужно
Модель (веса + активации + KV-кэш) должна помещаться в память GPU, иначе её приходится разбивать между картами с потерей скорости. Ориентиры по объёму: A100 — 40/80 ГБ, H100 — 80 ГБ, H200 — 141 ГБ, L40S — 48 ГБ. Для инференса LLM правило простое: больше HBM и выше её полоса — крупнее модель на одну карту и выше скорость генерации токенов. Поэтому H200 при том же чипе Hopper часто выгоднее H100 именно на инференсе.
Сервер, питание и охлаждение под GPU
Ускорители дата-центра требуют соответствующей платформы: HGX-плата под SXM или сервер с достаточным числом двойных PCIe-слотов и мощными БП (одна H100 SXM — до 700 Вт, узел из 8 карт — несколько кВт). Нужны продуманное охлаждение (воздух высокой плотности или жидкость), запас по питанию и стойка с соответствующим теплоотводом. Мы подбираем GPU, совместимые серверы (Supermicro, Dell, HPE), блоки питания и охлаждение комплектом и проверяем перед отгрузкой.
Как выбрать: коротко
Обучение больших LLM, много карт → H100/H200 SXM в HGX/DGX.
Инференс крупных моделей, память решает → H200 или несколько L40S.
Универсальный инференс, графика, видео → L40S (PCIe).
H100 (Hopper) новее и значительно быстрее для обучения LLM: Transformer Engine, поддержка FP8, HBM3. A100 (Ampere) — предыдущее поколение, дешевле, но всё ещё актуально для многих задач.
Чем H200 лучше H100?
Тот же вычислитель Hopper, но 141 ГБ HBM3e против 80 ГБ HBM3 и большая полоса памяти. На инференсе крупных моделей, где всё упирается в память, H200 заметно выгоднее.
SXM или PCIe — что выбрать?
SXM — для многокарточного обучения: максимум мощности и полный NVLink/NVSwitch между картами (платформы HGX/DGX). PCIe — проще интегрировать и охлаждать, оптимален для инференса и смешанных нагрузок.
Зачем нужен NVLink?
NVLink даёт быстрый прямой обмен между GPU, критичный при обучении на многих картах (синхронизация градиентов). Через PCIe этот обмен медленный. NVSwitch связывает все карты узла на полной скорости.
Почему важен объём HBM?
Модель должна поместиться в память карты, иначе её разбивают между GPU с потерей скорости. Больше HBM (H200 — 141 ГБ) — крупнее модель на одну карту и выше скорость инференса.
Что такое L40S и когда он подходит?
L40S (Ada, PCIe, 48 ГБ) — универсальный ускоритель под инференс, графику и видео, а также лёгкое обучение. Хороший выбор, когда не нужен полноскоростной NVLink кластера.
Что учесть по серверу и питанию?
Нужна платформа под нужный формат (HGX для SXM или сервер с двойными PCIe-слотами), мощные БП с запасом (H100 SXM — до 700 Вт), плотное охлаждение и подходящая стойка. Лучше подбирать GPU и сервер комплектом.