ITequipment.ruсетевое и серверное оборудование · МоскваПерейти в каталог →
Основы

Что такое LLM и зачем она бизнесу

LLM (Large Language Model) — большая языковая модель: нейросеть, которая обучена на огромном объёме текстов и умеет продолжать, пересказывать, переводить и анализировать текст и код. На ней работают чат-ассистенты, поиск по базе знаний компании и агенты, которые выполняют задачи.

Токен≈ часть слова, единица текста
Параметры«размер» модели: 7–400+ млрд
Контекстсколько текста модель видит за раз
Инференсработа уже обученной модели

Как работает LLM

Модель получает текст, разбитый на токены (части слов), и на каждом шаге предсказывает следующий токен. Внутри — архитектура трансформер: механизм внимания решает, какие части текста важны для ответа. Знания модели хранятся в параметрах — числах, подобранных во время обучения. Чем больше параметров, тем больше модель «знает» и тем больше памяти ей нужно.

Отдельно от параметров есть контекстное окно — сколько токенов модель учитывает одновременно: вопрос, историю диалога, приложенные документы. Длинный контекст расходует видеопамять на KV-кэш, поэтому сервер подбирают и под модель, и под длину запросов.

Обучение, дообучение и инференс

Обучение с нуля — самый дорогой этап: кластеры из сотен и тысяч ускорителей, недели работы. Компании почти никогда этого не делают, а берут готовые открытые модели.

Дообучение (fine-tuning, чаще LoRA/QLoRA) подстраивает готовую модель под свой стиль, термины и форматы. Хватает одного-двух мощных GPU.

Инференс — это работа модели: ответы пользователям. Здесь важны объём видеопамяти, скорость генерации (токенов в секунду) и сколько запросов сервер держит одновременно.

Открытые и закрытые модели

Закрытые модели доступны только через облачный API провайдера — данные уходят наружу. Открытые модели (семейства Llama, Qwen, DeepSeek, Mistral, Gemma и другие) можно скачать и запустить на своём сервере: данные не покидают контур компании, нет платы за каждый запрос, модель можно дообучить. Перед использованием проверяйте лицензию конкретной модели — у некоторых есть ограничения для коммерческого применения.

Что делают с LLM в компании

Что нужно, чтобы запустить LLM у себя

Главное ограничение — видеопамять: веса модели и KV-кэш должны поместиться в память GPU (или в общую память у настольных станций с единой памятью). Оцените требования калькулятором:

Сколько видеопамяти нужно под модель

Грубая оценка: веса = параметры × байты на параметр, плюс запас на KV-кэш и активации. Точный расчёт зависит от длины контекста, числа одновременных пользователей и движка (vLLM, TensorRT-LLM, llama.cpp).

Дальше — выбор между настольной станцией, сервером на несколько ускорителей и кластером. Подробно — в разборе какой сервер нужен под LLM.

Оборудование в каталоге

Читайте дальше

Купить GPU-серверGPU-сервер дёшевоСервер для ИИ · Весь раздел GPU

Вопросы и ответы

Вопросы по теме

Чем LLM отличается от ChatGPT?
ChatGPT — готовый сервис поверх закрытых моделей. LLM — сама модель; открытую LLM можно запустить на своём оборудовании и получить похожего ассистента без передачи данных наружу.
Сколько параметров нужно для бизнес-задач?
Для поиска по документам и черновиков ответов часто хватает моделей на 7–32 млрд параметров; для сложных рассуждений и кода берут 70 млрд и больше. Правильный размер подбирают на пилоте с вашими данными.
Можно ли запустить LLM без видеокарты?
Небольшие квантизованные модели работают и на процессоре, но медленно. Для нескольких пользователей и приемлемой скорости нужен GPU или станция с единой памятью.
Что такое квантизация?
Хранение весов с меньшей точностью (8 или 4 бита вместо 16). Модель занимает в 2–4 раза меньше памяти при небольшой потере качества — это главный способ сэкономить на железе.
Безопасно ли держать LLM у себя?
Своя модель в закрытом контуре — самый надёжный вариант для персональных и коммерческих данных: запросы и документы не покидают инфраструктуру компании.