Какой сервер нужен под LLM: считаем память и выбираем платформу
Сервер под LLM подбирают в три шага: сколько памяти займёт модель в выбранной точности, сколько добавят KV-кэш и одновременные пользователи, и какая платформа даёт эту память с нужной скоростью. Ниже — методика, калькулятор и типовые конфигурации.
Шаг 1. Память под веса
Объём весов ≈ число параметров × байты на параметр. В 16 битах (FP16/BF16) — 2 байта, в 8 битах — 1 байт, в 4 битах — 0,5 байта. Модель на 70 млрд параметров займёт около 140 ГБ в FP16, 70 ГБ в FP8 и 35 ГБ в INT4.
Шаг 2. KV-кэш и пользователи
При генерации модель хранит промежуточные результаты для каждого токена контекста — KV-кэш. Он растёт с длиной контекста и числом одновременных диалогов. Для чата с короткими запросами закладывают около 20 % сверху, для длинных документов и десятков пользователей — 50 % и больше. Серверы инференса (vLLM и аналоги) эффективно распределяют кэш, но физическая память всё равно нужна.
Грубая оценка: веса = параметры × байты на параметр, плюс запас на KV-кэш и активации. Точный расчёт зависит от длины контекста, числа одновременных пользователей и движка (vLLM, TensorRT-LLM, llama.cpp).
Шаг 3. Выбор платформы
| Задача | Платформа | Почему |
| Разработчик, пилот, модели до ~70 млрд в 4 битах | Настольная AI-станция с единой памятью или рабочая станция с одной картой на 48–96 ГБ | Недорого, тихо, не нужен ЦОД |
| Отдел, 10–50 пользователей, модели 30–70 млрд | Сервер 2U/4U на 2–4 PCIe-ускорителя | Запас памяти под KV-кэш и одновременные запросы |
| Компания, сотни пользователей, модели 70–400 млрд | Сервер HGX на 8 ускорителей с NVLink | Модель делится между GPU с минимальными задержками |
| Обучение и дообучение больших моделей | Несколько узлов HGX/DGX + InfiniBand или Ethernet 400G | Нужна быстрая сеть между узлами |
Скорость: что кроме памяти
Скорость генерации ограничена пропускной способностью памяти ускорителя, поэтому HBM-память серверных GPU даёт больше токенов в секунду, чем обычная. При разбиении модели на несколько GPU важна связь между ними: NVLink в HGX-платформах быстрее PCIe в разы. Для многих пользователей решает пакетная обработка в движке инференса.
Питание, охлаждение и стойка
Одна карта рабочей станции — сотни ватт; сервер на 8 ускорителей потребляет порядка 10 кВт и больше. Проверьте мощность вводов, PDU, ИБП и охлаждение до покупки. Мы считаем энергопотребление и тепловыделение под конкретную конфигурацию.
Оборудование в каталоге
Читайте дальше
Купить сервер под LLMGPU-серверыКонфигуратор