Коротко: GPU-сервер для ИИ подбирают от задачи: обучение крупных моделей, дообучение или инференс требуют разных ускорителей, памяти и охлаждения. Разберём, как выбрать GPU и платформу и на чём не стоит экономить.
H100/H200 (Hopper) — для обучения и инференса больших LLM; H200 несёт 141 ГБ HBM3e против 80 ГБ у H100 и выгоднее там, где всё упирается в память. A100 (80/40 ГБ HBM2e) — проверенный ускоритель обучения и HPC с NVLink и MIG. L40S (48 ГБ GDDR6, Ada) — универсал для инференса, дообучения, графики и видео на PCIe. Для чистого обучения берут SXM-платформы (H100/H200/A100), для инференса и смешанных нагрузок — PCIe (L40S, A100 PCIe).
SXM — модули на плате HGX с быстрым NVLink/NVSwitch между GPU: максимальная связность для многокарточного обучения, но это цельная платформа (обычно 4–8 GPU) с высоким питанием и жидкостным или мощным воздушным охлаждением. PCIe — обычные карты в слотах, гибче и дешевле масштабируются по одной-две, NVLink-мост опционален. Если модель делится между многими GPU — нужен SXM с NVLink; если карты работают независимо (инференс) — достаточно PCIe.
Это то, на чём нельзя экономить: один H100 SXM потребляет до 700 Вт, узел из 8 GPU — несколько киловатт. Нужны блоки питания с запасом и резервированием, продуманный воздушный поток (высокооборотные вентиляторы, «горячий» и «холодный» коридоры) или жидкостное охлаждение, а также стойка и ИБП/PDU соответствующей мощности. Неверный расчёт питания и охлаждения — главная причина троттлинга и сбоев GPU-серверов.
Чтобы GPU не простаивали, платформу балансируют: достаточно ядер CPU и линий PCIe, много системной памяти (часто 512 ГБ–1 ТБ и выше), быстрые NVMe под датасеты и checkpoint. Для multi-node обучения критична сеть — 100/200/400G Ethernet или InfiniBand с RDMA. Экономия на CPU, RAM, дисках или сети превращает дорогие ускорители в узкое место.
GPU-сервер удобнее брать собранным и протестированным целиком: платформа (Supermicro, Dell, HPE, Gigabyte), совместимые GPU, питание, охлаждение и сеть под вашу задачу. A100 и более ранние карты доступны в б/у с проверкой; H100/H200 — чаще новые и под заказ. Пришлите задачу (обучение или инференс, размер моделей, число узлов) — соберём конфигурацию и рассчитаем поставку.