Self-hosted LLM: приватность и когда это важно
Живые данные: 1 пользователей · 0 оплаченных заказов
Self-hosted LLM — это модель, развёрнутая на вашем железе: запросы не покидают ваш контур, данные не проходят через чужие серверы. Звучит идеально для приватности, но на практике это дорогой инструмент под конкретные требования, а не универсальное решение. Разберём, когда развёртывание у себя действительно необходимо, когда хватит облачного API и как выстроить гибридную схему.
Когда self-hosting обязателен
Есть сценарии, где альтернативы нет:
- **Регуляторные требования.** Персональные данные, медицинские записи, банковская тайна — законы могут прямо требовать обработки внутри контура организации.
- **Коммерческая тайна.** Чертежи, финансовые модели, исходные коды ключевых продуктов — утечка недопустима даже теоретически.
- **Изолированные сети.** Госзаказ, оборонные и промышленные контуры с air gap: физически нет выхода в интернет, значит, облачный API недоступен по определению.
- **Договорные ограничения.** Клиенты иногда прямо запрещают передачу своих данных третьим сторонам.
- **Собственные дообученные веса.** Если модель обучена на ваших данных, её саму иногда нельзя раскрывать внешнему провайдеру.
Когда облачного API достаточно
- **Прототипы и MVP.** Утечка нечему — чувствительных данных ещё нет.
- **Публичный контент.** Генерация статей, описаний товаров, переводов — эти данные и так предназначены для публикации.
- **Внутренние инструменты.** Помощники для документации, код-ревью без core-логики, черновики писем.
- **Нестабильная нагрузка.** Держать GPU-кластер под 10% утилизации дороже, чем платить за токены по факту.
Реальная цена своего железа
Self-hosting — это не только стоимость GPU-сервера. Считайте совокупно:
- железо: сервер с 2–4 ускорителями плюс резерв на отказ;
- inference-сервер (vLLM или аналоги), мониторинг, обновление весов;
- минимум один инженер, который занимается этим постоянно;
- устаревание: железо морально стареет, а качество открытых моделей догоняет флагманы с лагом.
Для сравнения: облачный флагман glm-5.3 стоит $1.8 за миллион входных и $7 за миллион выходных токенов, его flash-версия glm-5.3-flash — $0.15/$0.55 (по курсу 88₽/$ это примерно 13₽ и 48₽). Чтобы окупить даже скромный локальный стенд, нужен очень большой и стабильный объём запросов.
Гибридная схема: приватность без своего железа
Чаще всего оптимум — не «всё локально», а дисциплина работы с данными:
1. **Классифицируйте данные.** Разделите потоки на «можно в облако» и «нельзя никуда». 2. **Анонимизируйте перед отправкой.** Маскируйте имена, телефоны, номера карт до вызова модели; подставляйте обратно после ответа. 3. **Минимизируйте контекст.** Отправляйте только нужный фрагмент документа, а не весь файл. 4. **Уточните политику логов.** Хранит ли провайдер запросы, сколько времени, можно ли отключить. 5. **Критичные шаги — локально.** Разбор ПДн и решения по чувствительным кейсам держите внутри, генерацию формулировок — снаружи.
Для поиска по своим документам (RAG) пригодятся эмбеддинги bge-m3 — $0.01, поддержка русского, английского, китайского и ещё сотни языков. Помните: векторы тоже производные данных, поэтому в жёстких контурах их считают локально.
Подключаем облачную модель как замену self-hosted
Если решили, что свой стенд вам не нужен, замена занимает минуты:
1. Установите SDK: `pip install openai`. 2. Получите API-ключ в личном кабинете и положите его в переменную окружения. 3. Укажите `base_url` на эндпоинт сервиса. 4. Выберите модель под задачу: glm-5.3-flash — дешёвые рассуждения с поддержкой русского, deepseek-v4-flash ($0.6/$2.4) — быстрые рассуждения для сложных задач, qwen3.6-35b ($0.5/$2.2) — универсальный чат.
import os
from openai import OpenAI
client = OpenAI(
base_url='https://api.example-ai.ru/v1', # эндпоинт из личного кабинета
api_key=os.environ['API_KEY'],
)
resp = client.chat.completions.create(
model='glm-5.3-flash', # $0.15 / $0.55 за млн входных/выходных токенов
messages=[
{'role': 'system', 'content': 'Ты ассистент поддержки. Не повторяй персональные данные пользователя в ответе.'},
{'role': 'user', 'content': 'Клиент пишет: платёж по карте не прошёл. Составь вежливый ответ без ПДн.'},
],
temperature=0.2,
)
print(resp.choices[0].message.content)
Неудачные задачи не тарифицируются — вы платите только за успешные вызовы, что упрощает эксперименты с промптами и анонимизацией.
Чек-лист перед выбором
- Есть юридическое требование держать данные внутри контура? Нет — берите облако.
- Посчитали TCO self-hosting на год: железо, люди, электричество, простои?
- Сверьте цену модели с объёмом: при 10 млн токенов в месяц разница между glm-5.3-flash и kimi-k3 ($5/$25) — это десятки долларов против тысяч.
- Нужен русский язык? Смотрите на glm-4.5-air ($0.25/$1.2) и glm-5.3-flash — они оптимизированы под RU.
- Нужны тяжёлые рассуждения? deepseek-v4-pro ($2.6/$7) или glm-5.3 ($1.8/$7) вместо дорогого локального стенда.
Итог
Self-hosting — не синоним безопасности, а ответ на конкретные юридические и инфраструктурные требования. Если таких нет, облачный API с дисциплиной анонимизации даёт сопоставимый уровень контроля при цене в разы ниже и без команды MLOps. Начните с классификации данных — она покажет, какая часть нагрузки действительно требует своего железа.
Актуальные цены
| Модель | Описание | Цена |
|---|---|---|
kolors | 1024×1024 · Kuaishou Kolors | $0.005 $/шт ≈0.4₽ |
qwen-image | Qwen-Image · высокое качество | $0.08 $/шт ≈7.0₽ |
qwen-image-2512 | 1024×1024 · Qwen-Image 2512 · новое поколение | $0.08 $/шт ≈7.0₽ |
deepseek-v4-flash | быстрые рассуждения DeepSeek | $0.6 / $2.4 $/1M ток |
deepseek-v4-pro | мощные рассуждения DeepSeek | $2.6 / $7 $/1M ток |
glm-4.5-air | быстрая и дешёвая · RU | $0.25 / $1.2 $/1M ток |
glm-4.5v | зрение GLM · RU | $0.3 / $1.5 $/1M ток |
glm-5.2 | Zhipu · баланс цена/качество | $1.3 / $5.2 $/1M ток |
glm-5.3 | флагман Zhipu · reasoning | $1.8 / $7 $/1M ток |
glm-5.3-flash | флагманская flash-модель · reasoning · RU | $0.15 / $0.55 $/1M ток |
kimi-k2.7-code | код и агенты Moonshot | $1.4 / $6 $/1M ток |
qwen3-vl-32b | зрение: фото → текст | $0.25 / $1 $/1M ток |
qwen3.5-122b | флагманский MoE Alibaba | $0.6 / $2.4 $/1M ток |
qwen3.6-35b | универсальный чат Alibaba | $0.5 / $2.2 $/1M ток |
qwen3.8-27b | новейшая модель Alibaba · reasoning | $0.5 / $2.5 $/1M ток |
kimi-k3 | флагман Moonshot · агенты и длинный текст | $5 / $25 $/1M ток |
bge-m3 | эмбеддинги для RAG · ru/en/zh + 100 языков | $0.01 $/1M ток |
wan22-t2v | 480p · Wan 2.2 текст→видео · $0.40 за ролик | $0.4 $/сек ≈35.2₽ |
wan22-i2v | 480p · Wan 2.2 фото→видео · $0.40 за ролик | $0.4 $/сек ≈35.2₽ |
Курс: 1$ ≈ 88₽. Неудачные задачи не тарифицируются.