«Обновления, которые вендор выпускал для других клиентов, могли влиять на наше качество». Эту строчку опубликовал крупный российский интегратор в разборе собственного ИИ-ассистента по внутренним документам.
Это разбор КРОКа на Хабре, март 2026 года. Ассистент по регламентам, методичкам, договорам и проектной документации, целиком внутри закрытого контура. Ядро системы они купили готовым у внешнего поставщика. В списке того, что далось им с этой платформой тяжелее всего, первым пунктом стоят его апдейты, менявшие качество, и метрика при них 85 процентов и 70. Что именно считают этими процентами, статья не поясняет.
Задача, с которой они начинали, знакома всем, у кого документов много. Поиск по внутренним документам формально работает, но нужное находится не сразу, и сотрудники нередко тратят часы, вспоминая формулировку документа, его место и контекст. Заметнее всего это для новых сотрудников и для любого, кто полез в документы, с которыми раньше не работал.
Сложнее техники, по их же словам, оказались процессы с поставщиком. Выстраивать пришлось, дословно, «регулярные статусы; прозрачность поставок; понятную схему согласования изменений».
Качество ответов они при этом меряют на собственных данных. Формируют эталонные документы и вопросы, прогоняют по ним систему и измеряют метрику. Фактический ответ сличается с ожидаемым по заданным критериям, сначала это делали руками, потом отдали отдельной модели, а случаи из живой работы пополняют библиотеку тестов. Свои наборы документов и типовых вопросов они готовили ещё на этапе выбора поставщика и по ним мерили качество ответов у кандидатов.
Дальше моё, в статье этого нет. Выглядит эталонный набор буднично. Профильный эксперт заказчика сам пишет список вопросов и правильные ответы к ним. Этот список и есть эталон, с которым дальше сверяют машину. У нас таких расчётов по пилотам одиннадцать, и в десяти из них этап, где заказчик собирает эталон и прогоняет по нему проверку, оказывается самым дорогим по его времени, от 32 до 82 часов его собственных специалистов.
У КРОКа история кончилась хорошо, система дошла до рабочего состояния. Но дошла она через почти год совместной работы с поставщиком. Мне кажется, граница между теми, у кого ИИ работает, и теми, у кого он однажды перестал, проходит именно здесь, по наличию своего эталона. Мы этот этап ставим в план пилота отдельной строкой, потому что без него о качестве ответов приходится верить подрядчику на слово.
Это разбор КРОКа на Хабре, март 2026 года. Ассистент по регламентам, методичкам, договорам и проектной документации, целиком внутри закрытого контура. Ядро системы они купили готовым у внешнего поставщика. В списке того, что далось им с этой платформой тяжелее всего, первым пунктом стоят его апдейты, менявшие качество, и метрика при них 85 процентов и 70. Что именно считают этими процентами, статья не поясняет.
Задача, с которой они начинали, знакома всем, у кого документов много. Поиск по внутренним документам формально работает, но нужное находится не сразу, и сотрудники нередко тратят часы, вспоминая формулировку документа, его место и контекст. Заметнее всего это для новых сотрудников и для любого, кто полез в документы, с которыми раньше не работал.
Сложнее техники, по их же словам, оказались процессы с поставщиком. Выстраивать пришлось, дословно, «регулярные статусы; прозрачность поставок; понятную схему согласования изменений».
Качество ответов они при этом меряют на собственных данных. Формируют эталонные документы и вопросы, прогоняют по ним систему и измеряют метрику. Фактический ответ сличается с ожидаемым по заданным критериям, сначала это делали руками, потом отдали отдельной модели, а случаи из живой работы пополняют библиотеку тестов. Свои наборы документов и типовых вопросов они готовили ещё на этапе выбора поставщика и по ним мерили качество ответов у кандидатов.
Дальше моё, в статье этого нет. Выглядит эталонный набор буднично. Профильный эксперт заказчика сам пишет список вопросов и правильные ответы к ним. Этот список и есть эталон, с которым дальше сверяют машину. У нас таких расчётов по пилотам одиннадцать, и в десяти из них этап, где заказчик собирает эталон и прогоняет по нему проверку, оказывается самым дорогим по его времени, от 32 до 82 часов его собственных специалистов.
У КРОКа история кончилась хорошо, система дошла до рабочего состояния. Но дошла она через почти год совместной работы с поставщиком. Мне кажется, граница между теми, у кого ИИ работает, и теми, у кого он однажды перестал, проходит именно здесь, по наличию своего эталона. Мы этот этап ставим в план пилота отдельной строкой, потому что без него о качестве ответов приходится верить подрядчику на слово.
❤2👍1
БизнесМатика
Рейтинг LLM-платформ для внедрения в контуре компании. Семь российских платформ 2026 года
Сравнение 7 российских LLM-платформ для установки в инфраструктуре заказчика, включая закрытый контур. Критерии сравнения включают сменяемость LLM, маскирование персональных данных и журнал действий.
Мы выпустили рейтинг LLM-платформ, в котором наша ИИ-платформа Svaya заняла первое место.
Это рейтинг про отдельную категорию софта. Банкам, страховым и промышленным компаниям часто нельзя выпускать перс. данные клиентов и внутренние документы за периметр своей сети, а прикладные задачи для LLM у них во многом те же, что у остальных. Под это ограничение сложились платформы, которые ставятся в инфраструктуре заказчика, включая закрытый контур без доступа в интернет. Мы сравнили 7 российских платформ по шести критериям - платформ, которые заявляют такую поставку или, как минимум, хранение данных внутри периметра заказчика. По нашему опыту, эти 6 пунктов заказчики выясняют у вендора первыми: от работы в контуре и поиска по документам компании до того, получает ли заказчик исходный код.
В тексте рейтинга объяснили, почему в рейтинге нет самих GigaChat и YandexGPT, хотя платформа GigaChat Enterprise в нём есть. LLM отвечает на запрос. Платформа отвечает за то, что происходит вокруг него. Кто имеет право его задать и по каким документам. Что замаскировать до отправки текста в LLM. Что записать в журнал для службы безопасности. Как заменить LLM, когда выйдет лучшая версия.
В конце статьи собраны пять вопросов заказчика к вендору перед выбором ИИ-платформы (любому, включая нас самих). Например, что нужно для старта (покупка программно-аппаратного комплекса или установка на имеющиеся серверы) или сколько инженеров (вендора или своих) потребует сопровождение.
Полный текст рейтинга тут.
Это рейтинг про отдельную категорию софта. Банкам, страховым и промышленным компаниям часто нельзя выпускать перс. данные клиентов и внутренние документы за периметр своей сети, а прикладные задачи для LLM у них во многом те же, что у остальных. Под это ограничение сложились платформы, которые ставятся в инфраструктуре заказчика, включая закрытый контур без доступа в интернет. Мы сравнили 7 российских платформ по шести критериям - платформ, которые заявляют такую поставку или, как минимум, хранение данных внутри периметра заказчика. По нашему опыту, эти 6 пунктов заказчики выясняют у вендора первыми: от работы в контуре и поиска по документам компании до того, получает ли заказчик исходный код.
В тексте рейтинга объяснили, почему в рейтинге нет самих GigaChat и YandexGPT, хотя платформа GigaChat Enterprise в нём есть. LLM отвечает на запрос. Платформа отвечает за то, что происходит вокруг него. Кто имеет право его задать и по каким документам. Что замаскировать до отправки текста в LLM. Что записать в журнал для службы безопасности. Как заменить LLM, когда выйдет лучшая версия.
В конце статьи собраны пять вопросов заказчика к вендору перед выбором ИИ-платформы (любому, включая нас самих). Например, что нужно для старта (покупка программно-аппаратного комплекса или установка на имеющиеся серверы) или сколько инженеров (вендора или своих) потребует сопровождение.
Полный текст рейтинга тут.
❤2👍2
БизнесМатика
Платформа для внедрения языковых моделей - это не обертка над GigaChat. Как устроена наша Svaya, от маскирования персональных данных…
БизнесМатика - это ИТ-компания, которая работает с 2012 года. Мы занимаемся заказной разработкой ПО и внедряем проекты на базе языковых моделей (LLM) для…
В России подписан закон об ИИ, 243-ФЗ, с 1 сентября он вступает в силу. Сам закон про большие фундаментальные ИИ-модели, включая LLM, и про господдержку их развития. Выглядит темой для разработчиков, а на деле задевает и обычные внедрения, где языковая модель встроена в рабочий процесс.
Закон описывает большие фундаментальные модели, от миллиарда параметров, и вводит для них две категории. Суверенная модель разработана российским юрлицом, контролируется им на всех стадиях жизненного цикла и живёт в российских дата-центрах. Национальную тоже разрабатывает российское юрлицо, но она может использовать зарубежные компоненты с открытой лицензией. Обе категории дают господдержку и доступ к государственным данным для обучения. Ещё одна норма отдаёт государству право требовать только российские модели в отдельных госсистемах и других чувствительных сферах.
Для внедрений это меняет порядок вопросов. Модель привыкли выбирать по тому, как она справляется с конкретной задачей. Теперь рядом с бенчмарком встаёт регуляторный статус. Какая модель лучшая, решает замер. Какая допустимая, решает регулятор, причём перечень чувствительных сфер закон оставляет за государством, и ответ может измениться после того, как ваш проект уже запущен.
Кроме этого, закон обязывает крупные площадки дать пользователям возможность помечать созданные нейросетями аудио- и визуальные материалы, а разработчикам разрешает обучать модели на правомерно доступных объектах авторского права. Детали в новости на Хабре.
Практический вывод архитектурный. Внедрение не должно прирастать к конкретной модели. Такая жёсткая связка превращает любой поворот регулятора в переписывание прикладной части, по цене нового проекта. Мы поэтому заложили сменяемость LLM в архитектуру своей ИИ-платформы Svaya. GigaChat, YandexGPT и открытые модели меняются в ней как компонент, прикладная часть остаётся на месте. Как это устроено, описано на сайте. Спросите свою команду, во что обойдётся замена модели в том, что у вас уже работает, и лучше до 1 сентября.
Закон описывает большие фундаментальные модели, от миллиарда параметров, и вводит для них две категории. Суверенная модель разработана российским юрлицом, контролируется им на всех стадиях жизненного цикла и живёт в российских дата-центрах. Национальную тоже разрабатывает российское юрлицо, но она может использовать зарубежные компоненты с открытой лицензией. Обе категории дают господдержку и доступ к государственным данным для обучения. Ещё одна норма отдаёт государству право требовать только российские модели в отдельных госсистемах и других чувствительных сферах.
Для внедрений это меняет порядок вопросов. Модель привыкли выбирать по тому, как она справляется с конкретной задачей. Теперь рядом с бенчмарком встаёт регуляторный статус. Какая модель лучшая, решает замер. Какая допустимая, решает регулятор, причём перечень чувствительных сфер закон оставляет за государством, и ответ может измениться после того, как ваш проект уже запущен.
Кроме этого, закон обязывает крупные площадки дать пользователям возможность помечать созданные нейросетями аудио- и визуальные материалы, а разработчикам разрешает обучать модели на правомерно доступных объектах авторского права. Детали в новости на Хабре.
Практический вывод архитектурный. Внедрение не должно прирастать к конкретной модели. Такая жёсткая связка превращает любой поворот регулятора в переписывание прикладной части, по цене нового проекта. Мы поэтому заложили сменяемость LLM в архитектуру своей ИИ-платформы Svaya. GigaChat, YandexGPT и открытые модели меняются в ней как компонент, прикладная часть остаётся на месте. Как это устроено, описано на сайте. Спросите свою команду, во что обойдётся замена модели в том, что у вас уже работает, и лучше до 1 сентября.
❤2👍1
Вышел Рейтинг Чиллнета 2026. БизнесМатика в нём на 26-м месте из ста в разделе аутстаффа и на 64-м из ста в разделе мобильной разработки. Разница между этими двумя строчками объясняется механикой рейтинга, и её стоит разобрать.
Чиллнет устроен непривычно. Он не собирает заявки и анкеты. Автор берёт четыре давно живущих рейтинга подрядчиков, Рейтинг Рунета, Workspace, Tagline и Digirate, и складывает места компаний в них. Правило сформулировано прямо. «Чем в большем количестве рейтингов компания участвует и чем выше ее места в них, тем больше баллов». Разделов пять, по сотне компаний в каждом. Сайты, мобильные приложения, аутстафф, дизайн, seo.
Отсюда следует, что балл здесь измеряет присутствие компании в чужих рейтингах. Наши две строчки это показывают. Раздел аутстаффа собран из трёх источников, и мы есть во всех трёх, правда не в верхах, на 36-м, 24-м и 57-м местах. В сумме 62 балла и 26-я строка. Раздел мобильной разработки собран из четырёх источников, и мы попали ровно в один. В сумме 41 балл и 64-я строка. О том, как мы делаем мобильные проекты, эта разница не говорит ничего.
Тому, кто выбирает подрядчика, отсюда следует простое. Агрегатор годится как список кандидатов. Оценкой работы он быть не может по устройству. Компания, которая не подавалась ни в один рейтинг, получит ноль, как бы она ни вела проекты. Смотреть надо методику первоисточника. Что там вообще ранжируется, отзывы, выручка, кейсы или аккуратно заполненная анкета.
Поэтому свои 26-е и 64-е места мы называем как есть, вместе с механикой, по которой они получились. Если рейтинг попадётся вам при выборе подрядчика, откройте его методику и спросите самого подрядчика, за что он получил своё место. Сам Рейтинг Чиллнета тут.
Чиллнет устроен непривычно. Он не собирает заявки и анкеты. Автор берёт четыре давно живущих рейтинга подрядчиков, Рейтинг Рунета, Workspace, Tagline и Digirate, и складывает места компаний в них. Правило сформулировано прямо. «Чем в большем количестве рейтингов компания участвует и чем выше ее места в них, тем больше баллов». Разделов пять, по сотне компаний в каждом. Сайты, мобильные приложения, аутстафф, дизайн, seo.
Отсюда следует, что балл здесь измеряет присутствие компании в чужих рейтингах. Наши две строчки это показывают. Раздел аутстаффа собран из трёх источников, и мы есть во всех трёх, правда не в верхах, на 36-м, 24-м и 57-м местах. В сумме 62 балла и 26-я строка. Раздел мобильной разработки собран из четырёх источников, и мы попали ровно в один. В сумме 41 балл и 64-я строка. О том, как мы делаем мобильные проекты, эта разница не говорит ничего.
Тому, кто выбирает подрядчика, отсюда следует простое. Агрегатор годится как список кандидатов. Оценкой работы он быть не может по устройству. Компания, которая не подавалась ни в один рейтинг, получит ноль, как бы она ни вела проекты. Смотреть надо методику первоисточника. Что там вообще ранжируется, отзывы, выручка, кейсы или аккуратно заполненная анкета.
Поэтому свои 26-е и 64-е места мы называем как есть, вместе с механикой, по которой они получились. Если рейтинг попадётся вам при выборе подрядчика, откройте его методику и спросите самого подрядчика, за что он получил своё место. Сам Рейтинг Чиллнета тут.
❤1🔥1
БизнесМатика
БизнесМатика — Заказная разработка, искусственный интеллект и усиление команд
Системный интегратор: ИИ-трансформация, ИТ-аутстаффинг, заказная разработка для среднего и крупного бизнеса.
Подрядчик, который считает вам смету, редко говорит, что проект вам не нужен. Сегодня мы выложили на сайт числа, ниже которых сами не берёмся за ИИ-проект.
Их десять, по одному на задачу нашей ИИ-платформы Svaya. Каталог примерно от 15 150 позиций для карточек товаров. От 750 часов аудитора в месяц для разбора финансовой отчётности. От 10 человек, занятых вычиткой документов полный день. И так по каждой строке, с ролями и оговорками.
Там же честно написано, чего эти числа стоят. Ни один расчёт ещё не проверен живым проектом. Четыре порога из 10 мы пересчитали 8 августа, потому что старые не сходились с нашим же калькулятором. А одиннадцатую задачу посчитали и пока не продаём. Внутри открыт спор, у кого в ней на самом деле высвобождается время, и мобильное рабочее место для неё пока не построено.
Зачем это читать вам. Найдёте свою строку и до всякой встречи с нами поймёте, проходит ли ваш масштаб. Если не проходит, вы узнали это заранее и бесплатно. Задача остаётся задачей, просто под неё не нужен такой проект. А если ИИ вам предлагает другой подрядчик, в конце есть четыре вопроса ему. Ниже какого объёма вы за эту задачу не берётесь?
Лонгрид целиком лежит по ссылке, читается минут за семь.
Их десять, по одному на задачу нашей ИИ-платформы Svaya. Каталог примерно от 15 150 позиций для карточек товаров. От 750 часов аудитора в месяц для разбора финансовой отчётности. От 10 человек, занятых вычиткой документов полный день. И так по каждой строке, с ролями и оговорками.
Там же честно написано, чего эти числа стоят. Ни один расчёт ещё не проверен живым проектом. Четыре порога из 10 мы пересчитали 8 августа, потому что старые не сходились с нашим же калькулятором. А одиннадцатую задачу посчитали и пока не продаём. Внутри открыт спор, у кого в ней на самом деле высвобождается время, и мобильное рабочее место для неё пока не построено.
Зачем это читать вам. Найдёте свою строку и до всякой встречи с нами поймёте, проходит ли ваш масштаб. Если не проходит, вы узнали это заранее и бесплатно. Задача остаётся задачей, просто под неё не нужен такой проект. А если ИИ вам предлагает другой подрядчик, в конце есть четыре вопроса ему. Ниже какого объёма вы за эту задачу не берётесь?
Лонгрид целиком лежит по ссылке, читается минут за семь.
❤1🔥1