Self-hosted LLM: приватность и когда это важно

Живые данные: 1 пользователей · 0 оплаченных заказов

Self-hosted LLM — это модель, развёрнутая на вашем железе: запросы не покидают ваш контур, данные не проходят через чужие серверы. Звучит идеально для приватности, но на практике это дорогой инструмент под конкретные требования, а не универсальное решение. Разберём, когда развёртывание у себя действительно необходимо, когда хватит облачного API и как выстроить гибридную схему.

Когда self-hosting обязателен

Есть сценарии, где альтернативы нет:

Когда облачного API достаточно

Реальная цена своего железа

Self-hosting — это не только стоимость GPU-сервера. Считайте совокупно:

Для сравнения: облачный флагман glm-5.3 стоит $1.8 за миллион входных и $7 за миллион выходных токенов, его flash-версия glm-5.3-flash — $0.15/$0.55 (по курсу 88₽/$ это примерно 13₽ и 48₽). Чтобы окупить даже скромный локальный стенд, нужен очень большой и стабильный объём запросов.

Гибридная схема: приватность без своего железа

Чаще всего оптимум — не «всё локально», а дисциплина работы с данными:

1. **Классифицируйте данные.** Разделите потоки на «можно в облако» и «нельзя никуда». 2. **Анонимизируйте перед отправкой.** Маскируйте имена, телефоны, номера карт до вызова модели; подставляйте обратно после ответа. 3. **Минимизируйте контекст.** Отправляйте только нужный фрагмент документа, а не весь файл. 4. **Уточните политику логов.** Хранит ли провайдер запросы, сколько времени, можно ли отключить. 5. **Критичные шаги — локально.** Разбор ПДн и решения по чувствительным кейсам держите внутри, генерацию формулировок — снаружи.

Для поиска по своим документам (RAG) пригодятся эмбеддинги bge-m3 — $0.01, поддержка русского, английского, китайского и ещё сотни языков. Помните: векторы тоже производные данных, поэтому в жёстких контурах их считают локально.

Подключаем облачную модель как замену self-hosted

Если решили, что свой стенд вам не нужен, замена занимает минуты:

1. Установите SDK: `pip install openai`. 2. Получите API-ключ в личном кабинете и положите его в переменную окружения. 3. Укажите `base_url` на эндпоинт сервиса. 4. Выберите модель под задачу: glm-5.3-flash — дешёвые рассуждения с поддержкой русского, deepseek-v4-flash ($0.6/$2.4) — быстрые рассуждения для сложных задач, qwen3.6-35b ($0.5/$2.2) — универсальный чат.

import os
from openai import OpenAI

client = OpenAI(
    base_url='https://api.example-ai.ru/v1',  # эндпоинт из личного кабинета
    api_key=os.environ['API_KEY'],
)

resp = client.chat.completions.create(
    model='glm-5.3-flash',  # $0.15 / $0.55 за млн входных/выходных токенов
    messages=[
        {'role': 'system', 'content': 'Ты ассистент поддержки. Не повторяй персональные данные пользователя в ответе.'},
        {'role': 'user', 'content': 'Клиент пишет: платёж по карте не прошёл. Составь вежливый ответ без ПДн.'},
    ],
    temperature=0.2,
)
print(resp.choices[0].message.content)

Неудачные задачи не тарифицируются — вы платите только за успешные вызовы, что упрощает эксперименты с промптами и анонимизацией.

Чек-лист перед выбором

Итог

Self-hosting — не синоним безопасности, а ответ на конкретные юридические и инфраструктурные требования. Если таких нет, облачный API с дисциплиной анонимизации даёт сопоставимый уровень контроля при цене в разы ниже и без команды MLOps. Начните с классификации данных — она покажет, какая часть нагрузки действительно требует своего железа.

Попробовать Rodnik →

Актуальные цены

МодельОписаниеЦена
kolors1024×1024 · Kuaishou Kolors$0.005 $/шт ≈0.4₽
qwen-imageQwen-Image · высокое качество$0.08 $/шт ≈7.0₽
qwen-image-25121024×1024 · Qwen-Image 2512 · новое поколение$0.08 $/шт ≈7.0₽
deepseek-v4-flashбыстрые рассуждения DeepSeek$0.6 / $2.4 $/1M ток
deepseek-v4-proмощные рассуждения DeepSeek$2.6 / $7 $/1M ток
glm-4.5-airбыстрая и дешёвая · RU$0.25 / $1.2 $/1M ток
glm-4.5vзрение GLM · RU$0.3 / $1.5 $/1M ток
glm-5.2Zhipu · баланс цена/качество$1.3 / $5.2 $/1M ток
glm-5.3флагман Zhipu · reasoning$1.8 / $7 $/1M ток
glm-5.3-flashфлагманская flash-модель · reasoning · RU$0.15 / $0.55 $/1M ток
kimi-k2.7-codeкод и агенты Moonshot$1.4 / $6 $/1M ток
qwen3-vl-32bзрение: фото → текст$0.25 / $1 $/1M ток
qwen3.5-122bфлагманский MoE Alibaba$0.6 / $2.4 $/1M ток
qwen3.6-35bуниверсальный чат Alibaba$0.5 / $2.2 $/1M ток
qwen3.8-27bновейшая модель Alibaba · reasoning$0.5 / $2.5 $/1M ток
kimi-k3флагман Moonshot · агенты и длинный текст$5 / $25 $/1M ток
bge-m3эмбеддинги для RAG · ru/en/zh + 100 языков$0.01 $/1M ток
wan22-t2v480p · Wan 2.2 текст→видео · $0.40 за ролик$0.4 $/сек ≈35.2₽
wan22-i2v480p · Wan 2.2 фото→видео · $0.40 за ролик$0.4 $/сек ≈35.2₽

Курс: 1$ ≈ 88₽. Неудачные задачи не тарифицируются.