← Медиа

Какую LLM развернуть on-premise под 152-ФЗ. Что требует закон, что решает железо и почему LLM должна быть сменяемой

Вопрос «какую LLM развернуть on-premise, чтобы соблюсти 152-ФЗ и не отдавать данные в облако» задают нам на пресейлах и задают поисковикам. Вопрос содержит ошибку. 152-ФЗ не требует своего сервера. Он требует, чтобы персональные данные граждан России записывались и хранились в базах на территории страны (статья 18, часть 5, норма действует с 1 сентября 2015 года). Он требует уведомить Роскомнадзор об обработке (статья 22, с 1 сентября 2022 года почти без исключений) и о трансграничной передаче (статья 12). И он заставляет отвечать за утечку деньгами. С 30 мая 2025 года штраф компании за утечку персональных данных доходит до 15 млн ₽, а повторная утечка обходится в 1-3% годовой выручки (статья 13.11 КоАП в редакции 420-ФЗ). Слов «свой сервер», «on-premise» и «запрещено облако» в законе нет.

Локальная LLM (большая языковая модель) on-premise нужна по другим причинам. Свой контур требуют отраслевые тайны, у каждой из которых своя статья. Его требует и статус значимого объекта КИИ (критической информационной инфраструктуры) у госоргана или заказчика по 223-ФЗ, где с 1 января 2025 года запрещено иностранное ПО. Ещё две причины ограничивают выбор LLM, хотя в контур сами по себе не ведут. Ведущие зарубежные LLM недоступны по API из России. Закон 243-ФЗ с 1 марта 2027 года даст Правительству право в отдельных случаях требовать только суверенные или национальные LLM, то есть LLM со статусом по этому закону. Если в промпт (текст запроса к LLM) идёт тайна, LLM ставится на своё железо. Своё железо это либо поставка вендора в ваш контур, либо LLM с открытыми весами. Поставка вендора это ПАК (программно-аппаратный комплекс, сервер с предустановленной LLM) или установка на ваши серверы, например GigaChat Enterprise, Yandex AI Studio on-premises или Cotype от MWS AI. Открытые веса значат, что файл LLM скачивают и запускают у себя, от одной видеокарты 24 ГБ до узла из восьми, например Qwen3.5, GigaChat3, T-pro, gpt-oss или DeepSeek. Если LLM ставится на значимый объект КИИ госоргана или заказчика по 223-ФЗ, ПО должно быть не иностранным, на практике это российский ПАК. Если в промпте только персональные данные без тайн, хватает российского облака с подтверждённым уровнем защищённости или гибрида, где документы в вашем контуре, а LLM в приватном облаке вендора. Облачные примеры это GigaChat API и Yandex AI Studio, уровень защищённости площадки запросите у вендора. Если в промпте ничего чувствительного, подходит любой российский API.

Поэтому «какую LLM» это третий вопрос по счёту. Сначала нужно понять, какие данные попадают в промпт, потом ответить, какое железо у вас есть или будет куплено, и только потом решать, как вы будете менять LLM. За два года она, скорее всего, сменится. Ниже разбор по каждому шагу с источниками.

Три вопроса по порядку. Какие данные идут в промпт, какое железо есть, как менять LLM
Три вопроса по порядку. Какие данные идут в промпт, какое железо есть или будет куплено, как вы будете менять LLM.

Что требует 152-ФЗ и чего в нём нет

Часть 5 статьи 18 152-ФЗ запрещает записывать, хранить и извлекать персональные данные граждан России с использованием баз данных за пределами страны. Исключения только по пунктам 2, 3, 4 и 8 части 1 статьи 6, то есть исполнение закона, правосудие, полномочия органов и журналистика. Про собственное оборудование там ничего нет. Облачная площадка в России под эту норму подходит, если база с персональными данными физически находится на её серверах в стране. Уведомление об обработке по статье 22 обходится в 100-300 тысяч ₽ штрафа, если его не подать. На наших пресейлах об этом уведомлении вспоминают реже, чем о локализации. Шкала за утечки идёт по числу пострадавших, от 3 до 15 млн ₽, за биометрию до 20 млн ₽, а повторная утечка стоит минимум 20 млн ₽, для биометрии минимум 25 млн ₽.

Статья 12 регулирует трансграничную передачу персональных данных. Оператор уведомляет Роскомнадзор до начала передачи, а ведомство за десять рабочих дней вправе её запретить или ограничить. Разъяснения регулятора про вызов зарубежной LLM по API мы не нашли. По определению из статьи 3 промпт с персональными данными, который уходит на сервер иностранной компании, это передача данных на территорию иностранного государства. Так мы читаем норму.

Что заставляет ставить LLM в свой контур и что ограничивает выбор LLM

Адвокатская тайна по статье 8 закона 63-ФЗ покрывает любые сведения, связанные с оказанием помощи доверителю. Аудиторская по статье 9 закона 307-ФЗ запрещает передавать документы клиента третьим лицам без письменного согласия. Банковская по статье 26 закона 395-1 обязывает хранить тайну об операциях, счетах и вкладах. Коммерческая тайна по статье 10 закона 98-ФЗ существует только после того, как компания ввела режим с перечнем сведений, ограничением доступа, учётом лиц, условиями в договорах и грифом. Ни одна из этих норм не упоминает LLM, и каждая ставит вопрос, вправе ли вы отдать эти документы на сервер третьей стороны, даже российской. Ответ на него даёт юрист компании.

Свой контур нужен и значимому объекту КИИ, но это узкая группа компаний. Указ Президента № 166 с 1 января 2025 года запрещает органам власти и заказчикам по 223-ФЗ использовать иностранное ПО на принадлежащих им значимых объектах критической информационной инфраструктуры. Статус значимого объекта есть у тех, кто провёл категорирование по 187-ФЗ, перечень значимых объектов лежит в вашей службе ИБ. Компания, которая не орган власти и не заказчик по 223-ФЗ, этой нормой не связана, даже если у неё есть значимые объекты КИИ. Для объекта под указом открытая LLM китайского или американского разработчика, по нашему чтению, попадает под иностранное ПО, и выбор сводится к российскому ПАК.

Выбор LLM ограничивает 243-ФЗ, закон о поддержке технологий ИИ, вступивший в силу 1 сентября 2026 года. Он вводит для LLM от 1 млрд параметров два статуса. Суверенная, если коротко, разработана российской компанией с воспроизводимым циклом разработки и данными в российских дата-центрах, национальная допускает зарубежные компоненты под открытой лицензией. Статья 5 даёт Правительству право устанавливать случаи, в которых допускаются исключительно такие LLM, вместе с перечнем исключений. В банковской сфере и иных сферах финансового рынка это делается по согласованию с Банком России. Статьи о статусах и об этом праве вступают в силу с 1 марта 2027 года (статья 13). К системам, созданным до этой даты, требование об исключительном применении таких LLM не применяется до 1 сентября 2032 года при условии, что данные обрабатываются в России. Порядок присвоения статусов, по публикации Коммерсанта в августе, существует только как проект Минцифры.

Второе ограничение выбора идёт не от закона. России нет в списках поддерживаемых стран у OpenAI и у Anthropic, поэтому выбор сводится к российским облачным LLM и LLM с открытыми весами на своём железе.

Какие данные попадают в промпт LLM

Разложите данные, которые уходят в LLM, на три класса. Это персональные данные сотрудников и клиентов, тайна в юридическом смысле и всё остальное, например регламенты, нормативные базы и обезличенные обращения. Тайна это клиентские документы у юристов и аудиторов, операции и счета у банка, рецептуры у производства. Два термина из таблицы ниже. Уровень защищённости (от УЗ-1, самого строгого, до УЗ-4) оператор определяет сам по постановлению Правительства № 1119. Он зависит от типа актуальных угроз, категории данных, того, сотрудники ли это, и числа людей в базе с порогом в 100 тысяч. Поручение обработки это договор по части 3 статьи 6 152-ФЗ, по которому облако обрабатывает данные от вашего имени.

Что в промптеКуда можноЧто проверить до старта
Ничего чувствительногоЛюбой российский API, облачный или в контуреДоговор с поставщиком, где хранятся логи запросов и как долго
Персональные данные без тайнРоссийское облако с подтверждённым уровнем защищённости, гибрид с данными в контуре или свой контурСтатья 18 часть 5, уведомление по статье 22, поручение обработки, уровень защищённости площадки
Тайна любого видаСвой контур, то есть поставка вендора или открытая LLM на своём железе. Гибрид, если юрист разрешил отправлять текст запроса на сервер вендораСвоя отраслевая статья и режим по 98-ФЗ, какой способ допустим, определяет юрист

Отдельно про КИИ. Если LLM ставится на значимый объект госоргана или заказчика по 223-ФЗ, иностранное ПО запрещено Указом 166 независимо от класса данных. Проверяйте пункт 1 «б» указа и перечень своих значимых объектов.

Аттестации системы 152-ФЗ не требует, только оценку эффективности мер защиты до ввода в эксплуатацию (статья 19, часть 2, пункт 4). По приказу ФСТЭК № 21 (ФСТЭК это регулятор по технической защите информации) её проводят сами или с лицензиатом не реже раза в три года. Аттестат обязателен только для государственных систем по приказу № 17. Провайдеры сообщают о своих уровнях сами. Cloud.ru заявляет УЗ-1, VK Cloud серверы с УЗ-1, УЗ-2 и УЗ-3, Selectel защиту до УЗ-1 по акту оценки эффективности, MWS меры под УЗ-1. Оператором при этом остаётесь вы, и ответственность перед субъектом данных по части 5 статьи 6 остаётся на вас.

Какое железо нужно под LLM on-premise

Объём видеопамяти задаёт класс LLM, который вы сможете запустить. Большинство LLM выкладывают в половинной точности, два байта на параметр, а часть флагманов (DeepSeek V4, gpt-oss) выходит сразу в восьми- или четырёхбитном сжатии. Сжатие до восьми и четырёх бит уменьшает память в два и четыре раза ценой небольшой потери качества. Разумный порядок это пилот на четырёхбитном сжатии и продакшн на восьмибитном или в половинной точности, а разницу проверять замером качества на своих документах. Ориентиры ниже посчитаны по этому правилу без учёта памяти под контекст (текст запроса и ответа), поэтому цифры в таблице оценочные. В колонке цены аренда в Cloud.ru или покупка по прайсу ServerMall на 6 сентября 2026 года.

Класс железаЧто помещаетсяОриентир цены
Одна видеокарта 24 ГБ7-10 млрд параметров в половинной точности, 27-35 млрд в четырёхбитном сжатииПотребительская видеокарта. Сервер под пилот по нашей оценке на май 2026 года 1,2-2,5 млн ₽
Две видеокарты 24 ГБ24-33 млрд в восьмибитном сжатииДве потребительские видеокарты
Одна видеокарта 80 ГБ24 млрд в половинной точности (около 55 ГБ по карточке Mistral), 70 млрд в восьмибитном сжатии впритык. gpt-oss-120b в формате MXFP4 (четырёхбитное сжатие) помещается в одну карту 80 ГБ по карточке OpenAIA100 в Cloud.ru около 427 ₽ за карту в час (сдаётся блоками по две, 854 ₽, с НДС, тариф с 14 августа 2026), H100 около 549 ₽ за карту в час (блок из пяти, 2 745 ₽)
Две-четыре видеокарты 80 ГБ70 млрд в половинной точности с запасом под контекст, 235-284 млрд MoE в четырёхбитном сжатииСервер с двумя H100 от 18,9 млн ₽
Узел из восьми видеокарт 80 ГБФлагманы с открытыми весами около 400 млрд параметров и большеВосьмикарточный узел от 27,5 млн ₽

На одну карту 24 ГБ помещаются Qwen3-8B, GigaChat3-10B-A1.8B и Cotype Light 3 на 9 млрд, а в четырёхбитном сжатии Qwen3.5-27B и LLM с архитектурой MoE около 30 млрд. MoE это LLM, где на каждый запрос работает часть параметров, памяти ей нужно как большой LLM, а скорость как у малой, запись A1.8B значит 1,8 млрд активных параметров. На одну карту 80 ГБ помещаются gpt-oss-120b и T-pro-it-2.1 на 33 млрд в восьмибитном сжатии. DeepSeek V4-Flash на 284 млрд выложен сразу в смешанном формате FP4 и FP8 и по расчёту требует четыре карты 80 ГБ. На узел из восьми карт помещаются Qwen3.5-397B-A17B и GigaChat3.5-432B-A28B, для которой карточка на Hugging Face (площадке, где публикуют открытые LLM) даёт пример запуска на восьми картах.

Публичных тарифов на GPU у российских облаков почти нет. Из пяти проверенных облаков открытый прайс на день проверки есть только у Cloud.ru. По нашей оценке на май 2026 года сервер под продакшн на двух-четырёх A100 укладывался в 8-15 млн ₽, только железо, и это карты прошлого поколения, поэтому сервер с двумя H100 у ServerMall дороже. Смету даёт поставщик.

Сервер вывода (программа, которая держит LLM в памяти видеокарты и отвечает на запросы по API) тоже сменяемый компонент. vLLM и SGLang распространяются под лицензией Apache 2.0 и отдают OpenAI-совместимый API, то есть формат запросов как у API OpenAI, стандарт де-факто. Text Generation Inference от Hugging Face в марте 2026 года переведён в архив с рекомендацией перейти на эти два. Прикладная часть (логика обработки запроса, инструкции к LLM, подключения к учётным системам) должна обращаться к LLM через OpenAI-совместимый интерфейс. Тогда ни смена сервера, ни смена LLM не трогают код.

Четыре способа развернуть LLM. Поставка вендора, открытая LLM, гибрид, облако

Слева направо. Поставка вендора в ваш контур, открытая LLM на своём железе, гибрид с документами в контуре и LLM в приватном облаке, облако по API
Четыре способа развернуть LLM. Поставка вендора в ваш контур, открытая LLM на своём железе, гибрид с документами в контуре и LLM в приватном облаке вендора, российское облако по API.

Поставка вендора в ваш контур. Сбер в марте 2026 года представил GigaChat Enterprise в трёх форматах. Это локальный ПАК для крупнейших компаний, банков и объектов КИИ, облако Сбера и гибрид, где данные хранятся на серверах компании, а LLM работает в приватном облаке. Яндекс на лендинге AI Studio обещает в вашей инфраструктуре «тот же интерфейс, модели по вашему выбору и инструменты, что и в облаке». По публикации о комплексе К2 НейроТех в поставку с этой платформой входят и открытые LLM. MWS AI (бывшая MTS AI) поставляет Cotype Pro 3 на 27 млрд параметров и Cotype Light 3 на 9 млрд в закрытый контур, в том числе под Astra Linux. Так сказано в сообщении компании, которое в июле 2026 года привели Ведомости. За LLM, обновления и совместимость в этом способе отвечает вендор. Цен в открытом доступе нет ни у одного из троих, состав LLM в ПАК не раскрывает Сбер.

Открытая LLM на своём железе. Лицензию читайте у конкретной LLM, лицензия семейства на неё не переносится. Все проверенные нами LLM Qwen3, Qwen3.5 и Qwen3.8 идут под лицензией Apache 2.0, а Qwen2.5-72B под собственной лицензией Qwen, где выше 100 млн активных пользователей в месяц нужен отдельный договор. DeepSeek R1 и V4 под лицензией MIT, а веса первого V3 шли под отдельной лицензией DeepSeek. T-pro-it-2.1 и T-lite от Т-Технологий (группа Т-Банка) под Apache 2.0 и собраны на базе Qwen3. gpt-oss от OpenAI и Mistral Small 3.2 под Apache 2.0. Мы сами в мае ставили Qwen2.5-72B под Apache 2.0 и ошибались. Лицензионных платежей в этом способе нет, контроль над данными и версией LLM полный, а установку, обновление и мониторинг LLM делают ваши инженеры.

Гибрид. Документы и поиск по ним остаются в контуре, LLM работает в приватном облаке вендора. Такой формат есть у Сбера и, по публикации kod.ru, у Яндекса. Своего GPU не нужно, но промпт уходит в облако вендора, и допустимость такого способа для адвокатской или аудиторской тайны определяет юрист.

Российское облако по API. Тарифы GigaChat API для юридических лиц опубликованы. Lite стоит 0,065 ₽, Pro 0,5 ₽ и Max 0,65 ₽ за тысячу токенов с НДС в синхронном режиме (токен это единица текста, которой считают объём запросов и ответов). Старт за день без железа, но способ годится только для данных без тайн, и договор с площадкой нужно читать до первого запроса. В любом из четырёх способов LLM должна остаться сменяемым компонентом, и это следующий раздел.

СпособГде документыГде LLMСвоё GPUЗа LLM и обновления отвечаетДля каких данных
Поставка вендора в контуру васу вас, ПАК или ваши серверыда, в ПАК или своёвендортайна, КИИ, персональные данные
Открытая LLM на своём железеу васу васдаваши инженерытайна, персональные данные; КИИ под указом только с юристом
Гибриду васприватное облако вендоранетвендорперсональные данные; тайна только с разрешения юриста
Российское облако по APIу площадки или у васоблако вендоранетвендорперсональные данные без тайн, всё нечувствительное

Как не привязываться к одной языковой модели и менять её без переписывания решения

За два года LLM в контуре, скорее всего, сменится, и причин три, регулятор, вендор или новое поколение открытых LLM. Регулятор это 243-ФЗ, описанный выше. Статья 8 закона обязывает разработчиков суверенных и национальных LLM определять правила эксплуатации, обновления и вывода из эксплуатации. У разработчика появится документ, по которому LLM снимают с поддержки, и ваша LLM может под него попасть.

Вендор меняет LLM сам. КРОК в статье на Хабре описывает свой внутренний RAG-ассистент (LLM отвечает с опорой на найденные документы). Первым среди самых трудных мест проекта там названы обновления поставщика платформы, менявшие качество ответов. Качество ассистента меняется, когда на вашей стороне никто ничего не трогал, и без собственного замера вы узнаете об этом от пользователей.

Открытые LLM за 2025-2026 годы сменили поколения Qwen3, Qwen3.5 и Qwen3.8, и LLM на класс лучше при том же железе выходит чаще, чем компания успевает провести закупку.

Требование к архитектуре из этого одно. Нужны единый интерфейс к LLM, промпты и проверки, вынесенные из LLM, и набор своих документов с эталонными ответами для замера до и после любой смены. В нашей ИИ-платформе Svaya это заложено так. LLM объявлена сменяемым компонентом. В описании задачи указан класс LLM, а какая именно LLM за ним стоит, задаётся в настройках установки, поэтому смена одной LLM на другую не требует переделки прикладной задачи. Ответ LLM, если в описании задачи объявлена проверка, оценивает отдельная LLM-оценщик по метрике из этого описания. Установка идёт на серверы заказчика или в его облако.

Какая открытая LLM лучше на русском по бенчмарку MERA

Открытый бенчмарк MERA Альянса в сфере ИИ (объединение Сбера, Яндекса и других российских компаний) 1 сентября 2026 года обновился до версии Text 2.0 с 12 тестами. На день проверки в таблице 37 LLM, все прогнаны командой MERA. Балл это средняя оценка по 12 тестам, максимум 1. Первые шесть мест занимают зарубежные закрытые LLM, лучшая открытая это Qwen3.5-397B-A17B на 7-м месте с 0,485. Лучшая из тех, что помещаются в одну карту 24 ГБ в четырёхбитном сжатии, это Qwen-AgentWorld-35B-A3B на 9-м месте с 0,468. Из плотных LLM (без MoE) Qwen3.6-27B стоит на 11-м месте с 0,435. T-pro-it-2.1 на 22-м месте с 0,196, T-lite-it-2.1 на 28-м с 0,13. В этой таблице они уступают Qwen того же размера, их плюс это российский разработчик. GigaChat, YandexGPT, DeepSeek и gpt-oss в таблице отсутствуют, и сравнивать их по ней нельзя. Таблица обновляется реже, чем выходят LLM, поэтому смотрите дату отправки результата.

Бенчмарк отбирает кандидатов, а решает замер на ваших документах до внедрения. Для него нужен набор реальных вопросов с эталонными ответами и метрика, по которой вы будете считать ответ верным.

Чего не делать

Не покупать вендорский ПАК под пилот, цена ПАК начинается с сервера, а пилот проверяется на одной видеокарте. Не считать российское облако равным своему контуру. По 152-ФЗ они равны, а по договору и по отраслевым тайнам различаются. Читать файл LICENSE конкретной LLM, лицензия семейства ничего не гарантирует. Не привязывать прикладную часть к одной LLM. И не откладывать проект из-за 243-ФЗ, системы, созданные до 1 марта 2027 года, защищены от требования об исключительном применении до сентября 2032 года. Если задача уже ясна, посмотрите, как выглядит ИИ-ассистент по базе знаний в нашем каталоге услуг.

Вопросы и ответы

Нужен ли on-premise для 152-ФЗ?

Нет. Закон требует хранить базы персональных данных в России, уведомить Роскомнадзор и отвечать за утечки. Свой сервер нужен, когда в промпт идёт отраслевая тайна или когда у госоргана или заказчика по 223-ФЗ значимый объект КИИ.

GigaChat или YandexGPT для бизнеса под 152-ФЗ?

Закон не запрещает ни того, ни другого. База персональных данных остаётся в России, площадка обеспечивает нужный уровень защищённости, в промпт не попадает ничего, защищённого отраслевой тайной. Оба вендора предлагают и поставку в контур заказчика, Сбер как ПАК GigaChat Enterprise, Яндекс как Yandex AI Studio on-premises. Выбирать между ними по замеру на ваших документах.

Какую открытую LLM поставить на одну видеокарту?

На карту 24 ГБ помещаются LLM от 7 до 10 млрд параметров в половинной точности, например Qwen3-8B, T-lite или GigaChat3-10B-A1.8B, и LLM на 27-35 млрд в четырёхбитном сжатии. На MERA Text 2.0 лучшая из помещающихся это Qwen-AgentWorld-35B-A3B.

Как не привязываться к одной языковой модели и менять её без переписывания решения?

Через OpenAI-совместимый интерфейс к серверу вывода, промпты и проверки вне LLM и набор своих документов для замера до и после смены. Так устроена наша ИИ-платформа Svaya.

Есть ли готовая платформа для LLM, которую можно поставить в своей инфраструктуре?

Есть, и не одна. Мы сравнивали их в рейтинге LLM-платформ для внедрения в контуре, в том числе GigaChat Enterprise и нашу Svaya, которая ставится на серверы заказчика с GigaChat, YandexGPT или открытой LLM.

Оговорки

Это не юридическая консультация, нормы перепроверьте с юристом под вашу отрасль. Все факты собраны на 6 сентября 2026 года по первоисточникам, ссылки на которые стоят в тексте, тексты законов взяты с consultant.ru. Оценки памяти под LLM это расчёт без учёта контекста, цены на железо это прайс одного поставщика и один публичный тариф облака. Своих живых установок LLM в закрытом контуре заказчика в этом тексте нет, наш опыт здесь это проектирование сменяемости в Svaya. LLM и цены меняются за месяцы, проверяйте дату.