
Вопрос «какую LLM развернуть on-premise, чтобы соблюсти 152-ФЗ и не отдавать данные в облако» задают нам на пресейлах и задают поисковикам. Вопрос содержит ошибку. 152-ФЗ не требует своего сервера. Он требует, чтобы персональные данные граждан России записывались и хранились в базах на территории страны (статья 18, часть 5, норма действует с 1 сентября 2015 года). Он требует уведомить Роскомнадзор об обработке (статья 22, с 1 сентября 2022 года почти без исключений) и о трансграничной передаче (статья 12). И он заставляет отвечать за утечку деньгами. С 30 мая 2025 года штраф компании за утечку персональных данных доходит до 15 млн ₽, а повторная утечка обходится в 1-3% годовой выручки (статья 13.11 КоАП в редакции 420-ФЗ). Слов «свой сервер», «on-premise» и «запрещено облако» в законе нет.
Локальная LLM (большая языковая модель) on-premise нужна по другим причинам. Свой контур требуют отраслевые тайны, у каждой из которых своя статья. Его требует и статус значимого объекта КИИ (критической информационной инфраструктуры) у госоргана или заказчика по 223-ФЗ, где с 1 января 2025 года запрещено иностранное ПО. Ещё две причины ограничивают выбор LLM, хотя в контур сами по себе не ведут. Ведущие зарубежные LLM недоступны по API из России. Закон 243-ФЗ с 1 марта 2027 года даст Правительству право в отдельных случаях требовать только суверенные или национальные LLM, то есть LLM со статусом по этому закону. Если в промпт (текст запроса к LLM) идёт тайна, LLM ставится на своё железо. Своё железо это либо поставка вендора в ваш контур, либо LLM с открытыми весами. Поставка вендора это ПАК (программно-аппаратный комплекс, сервер с предустановленной LLM) или установка на ваши серверы, например GigaChat Enterprise, Yandex AI Studio on-premises или Cotype от MWS AI. Открытые веса значат, что файл LLM скачивают и запускают у себя, от одной видеокарты 24 ГБ до узла из восьми, например Qwen3.5, GigaChat3, T-pro, gpt-oss или DeepSeek. Если LLM ставится на значимый объект КИИ госоргана или заказчика по 223-ФЗ, ПО должно быть не иностранным, на практике это российский ПАК. Если в промпте только персональные данные без тайн, хватает российского облака с подтверждённым уровнем защищённости или гибрида, где документы в вашем контуре, а LLM в приватном облаке вендора. Облачные примеры это GigaChat API и Yandex AI Studio, уровень защищённости площадки запросите у вендора. Если в промпте ничего чувствительного, подходит любой российский API.
Поэтому «какую LLM» это третий вопрос по счёту. Сначала нужно понять, какие данные попадают в промпт, потом ответить, какое железо у вас есть или будет куплено, и только потом решать, как вы будете менять LLM. За два года она, скорее всего, сменится. Ниже разбор по каждому шагу с источниками.
Что требует 152-ФЗ и чего в нём нет
Часть 5 статьи 18 152-ФЗ запрещает записывать, хранить и извлекать персональные данные граждан России с использованием баз данных за пределами страны. Исключения только по пунктам 2, 3, 4 и 8 части 1 статьи 6, то есть исполнение закона, правосудие, полномочия органов и журналистика. Про собственное оборудование там ничего нет. Облачная площадка в России под эту норму подходит, если база с персональными данными физически находится на её серверах в стране. Уведомление об обработке по статье 22 обходится в 100-300 тысяч ₽ штрафа, если его не подать. На наших пресейлах об этом уведомлении вспоминают реже, чем о локализации. Шкала за утечки идёт по числу пострадавших, от 3 до 15 млн ₽, за биометрию до 20 млн ₽, а повторная утечка стоит минимум 20 млн ₽, для биометрии минимум 25 млн ₽.
Статья 12 регулирует трансграничную передачу персональных данных. Оператор уведомляет Роскомнадзор до начала передачи, а ведомство за десять рабочих дней вправе её запретить или ограничить. Разъяснения регулятора про вызов зарубежной LLM по API мы не нашли. По определению из статьи 3 промпт с персональными данными, который уходит на сервер иностранной компании, это передача данных на территорию иностранного государства. Так мы читаем норму.
Что заставляет ставить LLM в свой контур и что ограничивает выбор LLM
Адвокатская тайна по статье 8 закона 63-ФЗ покрывает любые сведения, связанные с оказанием помощи доверителю. Аудиторская по статье 9 закона 307-ФЗ запрещает передавать документы клиента третьим лицам без письменного согласия. Банковская по статье 26 закона 395-1 обязывает хранить тайну об операциях, счетах и вкладах. Коммерческая тайна по статье 10 закона 98-ФЗ существует только после того, как компания ввела режим с перечнем сведений, ограничением доступа, учётом лиц, условиями в договорах и грифом. Ни одна из этих норм не упоминает LLM, и каждая ставит вопрос, вправе ли вы отдать эти документы на сервер третьей стороны, даже российской. Ответ на него даёт юрист компании.
Свой контур нужен и значимому объекту КИИ, но это узкая группа компаний. Указ Президента № 166 с 1 января 2025 года запрещает органам власти и заказчикам по 223-ФЗ использовать иностранное ПО на принадлежащих им значимых объектах критической информационной инфраструктуры. Статус значимого объекта есть у тех, кто провёл категорирование по 187-ФЗ, перечень значимых объектов лежит в вашей службе ИБ. Компания, которая не орган власти и не заказчик по 223-ФЗ, этой нормой не связана, даже если у неё есть значимые объекты КИИ. Для объекта под указом открытая LLM китайского или американского разработчика, по нашему чтению, попадает под иностранное ПО, и выбор сводится к российскому ПАК.
Выбор LLM ограничивает 243-ФЗ, закон о поддержке технологий ИИ, вступивший в силу 1 сентября 2026 года. Он вводит для LLM от 1 млрд параметров два статуса. Суверенная, если коротко, разработана российской компанией с воспроизводимым циклом разработки и данными в российских дата-центрах, национальная допускает зарубежные компоненты под открытой лицензией. Статья 5 даёт Правительству право устанавливать случаи, в которых допускаются исключительно такие LLM, вместе с перечнем исключений. В банковской сфере и иных сферах финансового рынка это делается по согласованию с Банком России. Статьи о статусах и об этом праве вступают в силу с 1 марта 2027 года (статья 13). К системам, созданным до этой даты, требование об исключительном применении таких LLM не применяется до 1 сентября 2032 года при условии, что данные обрабатываются в России. Порядок присвоения статусов, по публикации Коммерсанта в августе, существует только как проект Минцифры.
Второе ограничение выбора идёт не от закона. России нет в списках поддерживаемых стран у OpenAI и у Anthropic, поэтому выбор сводится к российским облачным LLM и LLM с открытыми весами на своём железе.
Какие данные попадают в промпт LLM
Разложите данные, которые уходят в LLM, на три класса. Это персональные данные сотрудников и клиентов, тайна в юридическом смысле и всё остальное, например регламенты, нормативные базы и обезличенные обращения. Тайна это клиентские документы у юристов и аудиторов, операции и счета у банка, рецептуры у производства. Два термина из таблицы ниже. Уровень защищённости (от УЗ-1, самого строгого, до УЗ-4) оператор определяет сам по постановлению Правительства № 1119. Он зависит от типа актуальных угроз, категории данных, того, сотрудники ли это, и числа людей в базе с порогом в 100 тысяч. Поручение обработки это договор по части 3 статьи 6 152-ФЗ, по которому облако обрабатывает данные от вашего имени.
| Что в промпте | Куда можно | Что проверить до старта |
|---|---|---|
| Ничего чувствительного | Любой российский API, облачный или в контуре | Договор с поставщиком, где хранятся логи запросов и как долго |
| Персональные данные без тайн | Российское облако с подтверждённым уровнем защищённости, гибрид с данными в контуре или свой контур | Статья 18 часть 5, уведомление по статье 22, поручение обработки, уровень защищённости площадки |
| Тайна любого вида | Свой контур, то есть поставка вендора или открытая LLM на своём железе. Гибрид, если юрист разрешил отправлять текст запроса на сервер вендора | Своя отраслевая статья и режим по 98-ФЗ, какой способ допустим, определяет юрист |
Отдельно про КИИ. Если LLM ставится на значимый объект госоргана или заказчика по 223-ФЗ, иностранное ПО запрещено Указом 166 независимо от класса данных. Проверяйте пункт 1 «б» указа и перечень своих значимых объектов.
Аттестации системы 152-ФЗ не требует, только оценку эффективности мер защиты до ввода в эксплуатацию (статья 19, часть 2, пункт 4). По приказу ФСТЭК № 21 (ФСТЭК это регулятор по технической защите информации) её проводят сами или с лицензиатом не реже раза в три года. Аттестат обязателен только для государственных систем по приказу № 17. Провайдеры сообщают о своих уровнях сами. Cloud.ru заявляет УЗ-1, VK Cloud серверы с УЗ-1, УЗ-2 и УЗ-3, Selectel защиту до УЗ-1 по акту оценки эффективности, MWS меры под УЗ-1. Оператором при этом остаётесь вы, и ответственность перед субъектом данных по части 5 статьи 6 остаётся на вас.
Какое железо нужно под LLM on-premise
Объём видеопамяти задаёт класс LLM, который вы сможете запустить. Большинство LLM выкладывают в половинной точности, два байта на параметр, а часть флагманов (DeepSeek V4, gpt-oss) выходит сразу в восьми- или четырёхбитном сжатии. Сжатие до восьми и четырёх бит уменьшает память в два и четыре раза ценой небольшой потери качества. Разумный порядок это пилот на четырёхбитном сжатии и продакшн на восьмибитном или в половинной точности, а разницу проверять замером качества на своих документах. Ориентиры ниже посчитаны по этому правилу без учёта памяти под контекст (текст запроса и ответа), поэтому цифры в таблице оценочные. В колонке цены аренда в Cloud.ru или покупка по прайсу ServerMall на 6 сентября 2026 года.
| Класс железа | Что помещается | Ориентир цены |
|---|---|---|
| Одна видеокарта 24 ГБ | 7-10 млрд параметров в половинной точности, 27-35 млрд в четырёхбитном сжатии | Потребительская видеокарта. Сервер под пилот по нашей оценке на май 2026 года 1,2-2,5 млн ₽ |
| Две видеокарты 24 ГБ | 24-33 млрд в восьмибитном сжатии | Две потребительские видеокарты |
| Одна видеокарта 80 ГБ | 24 млрд в половинной точности (около 55 ГБ по карточке Mistral), 70 млрд в восьмибитном сжатии впритык. gpt-oss-120b в формате MXFP4 (четырёхбитное сжатие) помещается в одну карту 80 ГБ по карточке OpenAI | A100 в Cloud.ru около 427 ₽ за карту в час (сдаётся блоками по две, 854 ₽, с НДС, тариф с 14 августа 2026), H100 около 549 ₽ за карту в час (блок из пяти, 2 745 ₽) |
| Две-четыре видеокарты 80 ГБ | 70 млрд в половинной точности с запасом под контекст, 235-284 млрд MoE в четырёхбитном сжатии | Сервер с двумя H100 от 18,9 млн ₽ |
| Узел из восьми видеокарт 80 ГБ | Флагманы с открытыми весами около 400 млрд параметров и больше | Восьмикарточный узел от 27,5 млн ₽ |
На одну карту 24 ГБ помещаются Qwen3-8B, GigaChat3-10B-A1.8B и Cotype Light 3 на 9 млрд, а в четырёхбитном сжатии Qwen3.5-27B и LLM с архитектурой MoE около 30 млрд. MoE это LLM, где на каждый запрос работает часть параметров, памяти ей нужно как большой LLM, а скорость как у малой, запись A1.8B значит 1,8 млрд активных параметров. На одну карту 80 ГБ помещаются gpt-oss-120b и T-pro-it-2.1 на 33 млрд в восьмибитном сжатии. DeepSeek V4-Flash на 284 млрд выложен сразу в смешанном формате FP4 и FP8 и по расчёту требует четыре карты 80 ГБ. На узел из восьми карт помещаются Qwen3.5-397B-A17B и GigaChat3.5-432B-A28B, для которой карточка на Hugging Face (площадке, где публикуют открытые LLM) даёт пример запуска на восьми картах.
Публичных тарифов на GPU у российских облаков почти нет. Из пяти проверенных облаков открытый прайс на день проверки есть только у Cloud.ru. По нашей оценке на май 2026 года сервер под продакшн на двух-четырёх A100 укладывался в 8-15 млн ₽, только железо, и это карты прошлого поколения, поэтому сервер с двумя H100 у ServerMall дороже. Смету даёт поставщик.
Сервер вывода (программа, которая держит LLM в памяти видеокарты и отвечает на запросы по API) тоже сменяемый компонент. vLLM и SGLang распространяются под лицензией Apache 2.0 и отдают OpenAI-совместимый API, то есть формат запросов как у API OpenAI, стандарт де-факто. Text Generation Inference от Hugging Face в марте 2026 года переведён в архив с рекомендацией перейти на эти два. Прикладная часть (логика обработки запроса, инструкции к LLM, подключения к учётным системам) должна обращаться к LLM через OpenAI-совместимый интерфейс. Тогда ни смена сервера, ни смена LLM не трогают код.
Четыре способа развернуть LLM. Поставка вендора, открытая LLM, гибрид, облако
Поставка вендора в ваш контур. Сбер в марте 2026 года представил GigaChat Enterprise в трёх форматах. Это локальный ПАК для крупнейших компаний, банков и объектов КИИ, облако Сбера и гибрид, где данные хранятся на серверах компании, а LLM работает в приватном облаке. Яндекс на лендинге AI Studio обещает в вашей инфраструктуре «тот же интерфейс, модели по вашему выбору и инструменты, что и в облаке». По публикации о комплексе К2 НейроТех в поставку с этой платформой входят и открытые LLM. MWS AI (бывшая MTS AI) поставляет Cotype Pro 3 на 27 млрд параметров и Cotype Light 3 на 9 млрд в закрытый контур, в том числе под Astra Linux. Так сказано в сообщении компании, которое в июле 2026 года привели Ведомости. За LLM, обновления и совместимость в этом способе отвечает вендор. Цен в открытом доступе нет ни у одного из троих, состав LLM в ПАК не раскрывает Сбер.
Открытая LLM на своём железе. Лицензию читайте у конкретной LLM, лицензия семейства на неё не переносится. Все проверенные нами LLM Qwen3, Qwen3.5 и Qwen3.8 идут под лицензией Apache 2.0, а Qwen2.5-72B под собственной лицензией Qwen, где выше 100 млн активных пользователей в месяц нужен отдельный договор. DeepSeek R1 и V4 под лицензией MIT, а веса первого V3 шли под отдельной лицензией DeepSeek. T-pro-it-2.1 и T-lite от Т-Технологий (группа Т-Банка) под Apache 2.0 и собраны на базе Qwen3. gpt-oss от OpenAI и Mistral Small 3.2 под Apache 2.0. Мы сами в мае ставили Qwen2.5-72B под Apache 2.0 и ошибались. Лицензионных платежей в этом способе нет, контроль над данными и версией LLM полный, а установку, обновление и мониторинг LLM делают ваши инженеры.
Гибрид. Документы и поиск по ним остаются в контуре, LLM работает в приватном облаке вендора. Такой формат есть у Сбера и, по публикации kod.ru, у Яндекса. Своего GPU не нужно, но промпт уходит в облако вендора, и допустимость такого способа для адвокатской или аудиторской тайны определяет юрист.
Российское облако по API. Тарифы GigaChat API для юридических лиц опубликованы. Lite стоит 0,065 ₽, Pro 0,5 ₽ и Max 0,65 ₽ за тысячу токенов с НДС в синхронном режиме (токен это единица текста, которой считают объём запросов и ответов). Старт за день без железа, но способ годится только для данных без тайн, и договор с площадкой нужно читать до первого запроса. В любом из четырёх способов LLM должна остаться сменяемым компонентом, и это следующий раздел.
| Способ | Где документы | Где LLM | Своё GPU | За LLM и обновления отвечает | Для каких данных |
|---|---|---|---|---|---|
| Поставка вендора в контур | у вас | у вас, ПАК или ваши серверы | да, в ПАК или своё | вендор | тайна, КИИ, персональные данные |
| Открытая LLM на своём железе | у вас | у вас | да | ваши инженеры | тайна, персональные данные; КИИ под указом только с юристом |
| Гибрид | у вас | приватное облако вендора | нет | вендор | персональные данные; тайна только с разрешения юриста |
| Российское облако по API | у площадки или у вас | облако вендора | нет | вендор | персональные данные без тайн, всё нечувствительное |
Как не привязываться к одной языковой модели и менять её без переписывания решения
За два года LLM в контуре, скорее всего, сменится, и причин три, регулятор, вендор или новое поколение открытых LLM. Регулятор это 243-ФЗ, описанный выше. Статья 8 закона обязывает разработчиков суверенных и национальных LLM определять правила эксплуатации, обновления и вывода из эксплуатации. У разработчика появится документ, по которому LLM снимают с поддержки, и ваша LLM может под него попасть.
Вендор меняет LLM сам. КРОК в статье на Хабре описывает свой внутренний RAG-ассистент (LLM отвечает с опорой на найденные документы). Первым среди самых трудных мест проекта там названы обновления поставщика платформы, менявшие качество ответов. Качество ассистента меняется, когда на вашей стороне никто ничего не трогал, и без собственного замера вы узнаете об этом от пользователей.
Открытые LLM за 2025-2026 годы сменили поколения Qwen3, Qwen3.5 и Qwen3.8, и LLM на класс лучше при том же железе выходит чаще, чем компания успевает провести закупку.
Требование к архитектуре из этого одно. Нужны единый интерфейс к LLM, промпты и проверки, вынесенные из LLM, и набор своих документов с эталонными ответами для замера до и после любой смены. В нашей ИИ-платформе Svaya это заложено так. LLM объявлена сменяемым компонентом. В описании задачи указан класс LLM, а какая именно LLM за ним стоит, задаётся в настройках установки, поэтому смена одной LLM на другую не требует переделки прикладной задачи. Ответ LLM, если в описании задачи объявлена проверка, оценивает отдельная LLM-оценщик по метрике из этого описания. Установка идёт на серверы заказчика или в его облако.
Какая открытая LLM лучше на русском по бенчмарку MERA
Открытый бенчмарк MERA Альянса в сфере ИИ (объединение Сбера, Яндекса и других российских компаний) 1 сентября 2026 года обновился до версии Text 2.0 с 12 тестами. На день проверки в таблице 37 LLM, все прогнаны командой MERA. Балл это средняя оценка по 12 тестам, максимум 1. Первые шесть мест занимают зарубежные закрытые LLM, лучшая открытая это Qwen3.5-397B-A17B на 7-м месте с 0,485. Лучшая из тех, что помещаются в одну карту 24 ГБ в четырёхбитном сжатии, это Qwen-AgentWorld-35B-A3B на 9-м месте с 0,468. Из плотных LLM (без MoE) Qwen3.6-27B стоит на 11-м месте с 0,435. T-pro-it-2.1 на 22-м месте с 0,196, T-lite-it-2.1 на 28-м с 0,13. В этой таблице они уступают Qwen того же размера, их плюс это российский разработчик. GigaChat, YandexGPT, DeepSeek и gpt-oss в таблице отсутствуют, и сравнивать их по ней нельзя. Таблица обновляется реже, чем выходят LLM, поэтому смотрите дату отправки результата.
Бенчмарк отбирает кандидатов, а решает замер на ваших документах до внедрения. Для него нужен набор реальных вопросов с эталонными ответами и метрика, по которой вы будете считать ответ верным.
Чего не делать
Не покупать вендорский ПАК под пилот, цена ПАК начинается с сервера, а пилот проверяется на одной видеокарте. Не считать российское облако равным своему контуру. По 152-ФЗ они равны, а по договору и по отраслевым тайнам различаются. Читать файл LICENSE конкретной LLM, лицензия семейства ничего не гарантирует. Не привязывать прикладную часть к одной LLM. И не откладывать проект из-за 243-ФЗ, системы, созданные до 1 марта 2027 года, защищены от требования об исключительном применении до сентября 2032 года. Если задача уже ясна, посмотрите, как выглядит ИИ-ассистент по базе знаний в нашем каталоге услуг.
Вопросы и ответы
Нужен ли on-premise для 152-ФЗ?
Нет. Закон требует хранить базы персональных данных в России, уведомить Роскомнадзор и отвечать за утечки. Свой сервер нужен, когда в промпт идёт отраслевая тайна или когда у госоргана или заказчика по 223-ФЗ значимый объект КИИ.
GigaChat или YandexGPT для бизнеса под 152-ФЗ?
Закон не запрещает ни того, ни другого. База персональных данных остаётся в России, площадка обеспечивает нужный уровень защищённости, в промпт не попадает ничего, защищённого отраслевой тайной. Оба вендора предлагают и поставку в контур заказчика, Сбер как ПАК GigaChat Enterprise, Яндекс как Yandex AI Studio on-premises. Выбирать между ними по замеру на ваших документах.
Какую открытую LLM поставить на одну видеокарту?
На карту 24 ГБ помещаются LLM от 7 до 10 млрд параметров в половинной точности, например Qwen3-8B, T-lite или GigaChat3-10B-A1.8B, и LLM на 27-35 млрд в четырёхбитном сжатии. На MERA Text 2.0 лучшая из помещающихся это Qwen-AgentWorld-35B-A3B.
Как не привязываться к одной языковой модели и менять её без переписывания решения?
Через OpenAI-совместимый интерфейс к серверу вывода, промпты и проверки вне LLM и набор своих документов для замера до и после смены. Так устроена наша ИИ-платформа Svaya.
Есть ли готовая платформа для LLM, которую можно поставить в своей инфраструктуре?
Есть, и не одна. Мы сравнивали их в рейтинге LLM-платформ для внедрения в контуре, в том числе GigaChat Enterprise и нашу Svaya, которая ставится на серверы заказчика с GigaChat, YandexGPT или открытой LLM.
Оговорки
Это не юридическая консультация, нормы перепроверьте с юристом под вашу отрасль. Все факты собраны на 6 сентября 2026 года по первоисточникам, ссылки на которые стоят в тексте, тексты законов взяты с consultant.ru. Оценки памяти под LLM это расчёт без учёта контекста, цены на железо это прайс одного поставщика и один публичный тариф облака. Своих живых установок LLM в закрытом контуре заказчика в этом тексте нет, наш опыт здесь это проектирование сменяемости в Svaya. LLM и цены меняются за месяцы, проверяйте дату.