Что такое LLM и зачем она бизнесу
LLM (Large Language Model) — большая языковая модель: нейросеть, которая обучена на огромном объёме текстов и умеет продолжать, пересказывать, переводить и анализировать текст и код. На ней работают чат-ассистенты, поиск по базе знаний компании и агенты, которые выполняют задачи.
Как работает LLM
Модель получает текст, разбитый на токены (части слов), и на каждом шаге предсказывает следующий токен. Внутри — архитектура трансформер: механизм внимания решает, какие части текста важны для ответа. Знания модели хранятся в параметрах — числах, подобранных во время обучения. Чем больше параметров, тем больше модель «знает» и тем больше памяти ей нужно.
Отдельно от параметров есть контекстное окно — сколько токенов модель учитывает одновременно: вопрос, историю диалога, приложенные документы. Длинный контекст расходует видеопамять на KV-кэш, поэтому сервер подбирают и под модель, и под длину запросов.
Обучение, дообучение и инференс
Обучение с нуля — самый дорогой этап: кластеры из сотен и тысяч ускорителей, недели работы. Компании почти никогда этого не делают, а берут готовые открытые модели.
Дообучение (fine-tuning, чаще LoRA/QLoRA) подстраивает готовую модель под свой стиль, термины и форматы. Хватает одного-двух мощных GPU.
Инференс — это работа модели: ответы пользователям. Здесь важны объём видеопамяти, скорость генерации (токенов в секунду) и сколько запросов сервер держит одновременно.
Открытые и закрытые модели
Закрытые модели доступны только через облачный API провайдера — данные уходят наружу. Открытые модели (семейства Llama, Qwen, DeepSeek, Mistral, Gemma и другие) можно скачать и запустить на своём сервере: данные не покидают контур компании, нет платы за каждый запрос, модель можно дообучить. Перед использованием проверяйте лицензию конкретной модели — у некоторых есть ограничения для коммерческого применения.
Что делают с LLM в компании
- Поиск по базе знаний (RAG): ответы по регламентам, договорам, технической документации со ссылкой на источник.
- Поддержка и продажи: черновики ответов клиентам, разбор обращений, квалификация заявок.
- Разработка: ассистент программиста внутри контура, ревью кода, генерация тестов.
- Документы: суммаризация, извлечение данных из счетов и актов, перевод.
- Агенты: модель сама вызывает инструменты — CRM, базу данных, почту — и выполняет цепочку шагов.
Что нужно, чтобы запустить LLM у себя
Главное ограничение — видеопамять: веса модели и KV-кэш должны поместиться в память GPU (или в общую память у настольных станций с единой памятью). Оцените требования калькулятором:
Грубая оценка: веса = параметры × байты на параметр, плюс запас на KV-кэш и активации. Точный расчёт зависит от длины контекста, числа одновременных пользователей и движка (vLLM, TensorRT-LLM, llama.cpp).
Дальше — выбор между настольной станцией, сервером на несколько ускорителей и кластером. Подробно — в разборе какой сервер нужен под LLM.
Оборудование в каталоге
Читайте дальше
Купить GPU-серверGPU-сервер дёшевоСервер для ИИ · Весь раздел GPU