← Медиа

Корпоративная база знаний на основе RAG, который команда ИТ-Телеком развернула почти полностью своими руками

ИТ-Телеком строит ИТ-инфраструктуру, в компании до тридцати человек. Её технический руководитель был поисковой системой этой компании. К нему приходило по пять-десять вопросов в день, и чаще всего они сводились к одному, где такое уже делали и чем тогда комплектовали. Сейчас, по оценке компании, приходит один или два. Между этими двумя числами месяц или два, за которые команда клиента развернула у себя поиск по корпоративной базе знаний на основе RAG (Retrieval-Augmented Generation, «генерация, дополненная поиском/извлечением») по своим документам, и один участок, где понадобились чужие руки. Про него дальше и пойдёт речь.

Документами в компании пользуются проектировщики с производственно-техническим отделом и снабжение с коммерческим отделом. Первые смотрят в документацию по объектам, в нормативы и технические условия. Вторые - ищут, чем объект был укомплектован и чем это можно заменить. База знаний общая, вопросы к ней разные.

Что было до

Архив объектов жил в головах двух-трёх человек. Когда проектировщику нужно было понять, как компания решала похожую задачу на прошлом объекте, он шёл к техническому руководителю или к тому, кто тот объект вёл. Во вторую очередь открывал сетевую папку и смотрел проекты подряд, пока не находился похожий.

Часть вопросов уходила публичным чат-ботам вместе с рабочими документами. Компания сама строит ИТ-инфраструктуру и риск понимала, но быстрого способа получить ответ иначе у неё не было.

Взяться за задачу компанию заставили две причины, и обе про людей. Приходили новые сотрудники, и вход в курс дела занимал слишком много времени. И уходил человек, в голове которого жил архив объектов. Толчком стало наше предложение, тут мы себе не льстим. Спрос созрел раньше, мы только назначили дату разговора.

Что построили

Установку мы не видели, поэтому дальше в этом разделе всё со слов компании, а свойства ИИ-платформы Svaya взяты из её описания.

Компания купила годовую лицензию на платформу и развернула установку в арендованном облаке российского провайдера. Не на своём железе. Документы лежат на чужих машинах, и вопрос об уровне защищённости адресуется провайдеру. В поиск попали документация по объектам, нормативы с техническими условиями и коммерческие документы, включая прошлые предложения и закупки. Сколько это в файлах, мы не знаем.

Языковая модель у компании не стоит. Запросы уходят в облако российского вендора, и перед отправкой включено маскирование персональных данных. По описанию платформы корпус документов и эмбеддинги установку не покидают, наружу идёт только собранный запрос, и маскируется он до выхода. Маскирование ищет в тексте ФИО, паспорта, СНИЛС, ИНН, телефоны и адреса, порог приёмки платформы по полноте здесь 0,98. У ИТ-Телекома мы этого не замеряли.

Названия организаций в профиль маскирования не входят, техническое содержание запроса тоже. Значит фрагменты документов у вендора языковой модели оказываются, и слово «безопасно» здесь неуместно. Изменилось другое. Вендор российский и работает по договору, права доступа настроены внутри компании, а раньше тот же вопрос уходил в публичный сервис без всего перечисленного.

Что остаётся в установке и что уходит наружу. Документы и поисковый индекс внутри, наружу идёт только запрос, и он проходит через маскирование
Что остаётся в установке и что уходит наружу. Документы и поисковый индекс не покидают её, наружу идёт только собранный запрос, и на границе он проходит через маскирование.

Доступ к базе разграничен по отделам или по заказчикам, точную схему мы не видели. Права доступа платформа даёт готовыми, и это одна из частей, которые команде клиента не пришлось строить самой.

Что такое разбор документов и почему его отдали нам

От нас были годовая лицензия, консультации и проверка на контрольных точках. Установку разворачивала команда клиента. Исключение одно, и оно же главное содержание этого кейса. Разбор документов взяли мы, один человек и десятки часов.

Поиск по документам устроен в два шага. Сначала документ превращается в текст, который можно разрезать на осмысленные куски, и только потом по этим кускам ищут. Пока такого текста нет, поиску не за что зацепиться.

От чертежа к тексту и к кускам. Пока документ остаётся картинкой, поиску не за что зацепиться
Три состояния одного документа. Чертёж или скан, из которого поиску нечего взять. Тот же документ, превращённый в текст. Текст, разрезанный на куски, по которым и идёт поиск.

В разбор пошли чертежи, сканы, PDF без текстового слоя и спецификации таблицами. Распознавание входит в платформу, но на таком материале одного автоматического прохода мало, и остаток доводится руками. Что именно делал наш человек эти десятки часов, мы здесь не расписываем, потому что подробного отчёта о его работе у нас нет.

Так устроено не только у ИТ-Телекома. Чертежи и сканы лежат в архиве девелоперской компании, производственной компании и любого инжинирингового подрядчика, и ведут они себя одинаково.

Компания, которая профессионально строит ИТ-инфраструктуру, могла бы сделать разбор и сама. Почему не стала, нам не рассказывали. По проекту видно другое. Развернуть установку и разграничить права её команда смогла, а на качестве собственных документов понадобились чужие руки.

По словам компании, часть чертежей и сканов до сих пор ищется хуже остальных. Этим в компании продолжают заниматься.

Что изменилось

Число вопросов к техническому руководителю упало с 5-10 в день до 1-2. Обе величины компания называет по своей оценке. Замера не было ни до, ни после, и выдавать одно за другое мы не станем.

Технический руководитель ИТ-Телекома описывает это так.

«Раньше пять-десять раз в день ко мне приходили с вопросом, где мы это уже делали. Сейчас приходят раз или два, остальное люди находят сами.»

Поиском пользуются пока не все сотрудники. Компания считает, что это временно, пока не сложилась привычка. Своего обещания мы к этому не добавляем, потому что проверить его нечем.

Чего мы не проверяли

Какой именно провайдер арендован и заявляет ли он подтверждённый уровень защищённости по закону о персональных данных, мы не выясняли. Дат старта и запуска у нас нет, поэтому срок назван промежутком, месяц или два. Денег в этом кейсе нет вовсе, ни стоимости лицензии, ни сравнения с альтернативой.

Сейчас компания доводит начатое, добирает документы и дочищает разбор чертежей. О второй задаче на той же платформе они думают, но конкретики пока нет, и обещать её за них мы не будем.

Что с этим делать

Если вы собираетесь ставить поиск по своим документам, посмотрите на свой архив раньше, чем на подрядчиков и на архитектуру. Откройте десяток самых нужных документов и ответьте, текст это или картинка. Если картинка, то разбор документов окажется отдельной и, скорее всего, недооценённой строкой сметы, и от того, кто эту работу делает, зависит и срок, и цена.

Дальше спросите подрядчика:

  • что из проекта ваша команда может сделать сама и что остаётся подрядчику;
  • как в смете выделен разбор документов, отдельной строкой или растворён в общей цене (растворён значит недооценён);
  • что именно уходит во внешнюю языковую модель и что из этого маскируется.

Такую поставку мы делаем. Годовая лицензия на платформу, установку разворачивает ваша команда, от нас консультации и проверка на контрольных точках. Там, где своими руками не выходит, берёмся мы, и разбор документов это ровно такое место. Если хотите понять, во что превратится ваш архив, напишите нам.