Документация › Инструменты бота › База знаний
База знаний (RAG)
Сюда грузишь факты о бизнесе (прайс, услуги, условия): бот сам подмешивает нужное в ответы и перестаёт выдумывать.
⏱ 8 мин · 👤 для владельца и оператора · 🟢 live

За 30 секунд:
- База знаний = факты, на которые опирается бот: прайс, услуги, FAQ, условия.
- Грузишь текст, файл (TXT/CSV/PDF/DOCX) или ссылку (URL): система сама разбивает и индексирует.
- Бот на каждое сообщение ищет подходящие куски и добавляет их в ответ (это RAG, автоматически).
- Лимит: 100 записей на проект (всего, не только активных), до 1 000 000 символов при вставке текстом, из файла и со страницы по ссылке извлекается до 500 000, файл до 4 МБ.
- Статичные мелочи дешевле держать в промпте; большое/меняющееся, сюда.
Зачем это нужно
Бот знает только то, что ты ему дал. Если прайс есть лишь «в голове» у тебя, бот начнёт выдумывать цифры. База знаний даёт ему точные факты: он ищет в них релевантное под вопрос клиента и отвечает по делу, а не фантазирует. Это разница между «кажется, около 20 тысяч» и «чистка, 18 000 ₸».
Промпт или База знаний?
| Кладём в… | Что |
|---|---|
| 🧠 Промпт | Как себя вести, тон, правила, небольшие неизменные факты (адрес, часы) |
| 📚 База знаний | Объёмное и меняющееся: полный прайс, описания услуг, FAQ, условия доставки |
💡 Правило. Маленький статичный факт (адрес) в промпт (бесплатно). Большой список (прайс на 50 позиций) в базу знаний (бот достанет только нужное).
📌 Полный разбор «что в промпт, что в «Информацию о компании», что в базу знаний»: в отдельной статье Загрузить знания о бизнесе в бота.
Как добавить
Вкладка проекта «База знаний» → «Добавить базу знаний».
- Название: понятное («Прайс услуг», «FAQ доставки»);
- Тип, выбери источник:
- Текст: вставь напрямую (до 1 000 000 символов);
- Файл: TXT, CSV, PDF, DOCX (до 4 МБ, текст извлечётся сам);
- URL, ссылка на страницу сайта (можно с глубиной сканирования: только страница / +ссылки 1-2 уровня / максимум);
- (для URL) Автообновление, нет / еженедельно / ежемесячно;
- «Добавить»: пойдёт загрузка → индексация → готово.
⚠️ Обработка документа стоит немного (около $0.01 за документ на индексацию, минимальное списание, 1¢), спишется с баланса. При добавлении показывается оценка токенов.
Как бот это использует
Тебе ничего вызывать не надо, это работает само:
- Клиент пишет вопрос;
- Бот ищет в базе знаний тремя способами сразу: по смыслу (похожие формулировки), по словам (точное совпадение: артикул, марка, название модели) и с поправкой на опечатки. Результаты объединяются, и кусок, найденный двумя способами, идёт выше;
- Лучшие фрагменты (в сумме до 8 000 символов) добавляются в контекст ответа;
- Бот отвечает, опираясь на них.
📌 Пример. В базе это прайс и условия. Клиент: «делаете отбеливание и сколько?». Бот находит строку про отбеливание → отвечает с точной ценой. Про услугу, которой в базе нет, он честно скажет, что уточнит.
📌 Пример на точные слова. Клиент спрашивает «есть мойка 8102?». По смыслу «8102» не значит ничего, и поиск только по смыслу такой вопрос проваливал. Совпадение по словам находит строку каталога сразу.
«Всегда под рукой»
У каждой записи есть кнопка-скрепка. Включённая, она означает: этот документ едет боту в каждом сообщении, минуя поиск.
Это для короткой шпаргалки, которую бот обязан знать всегда: пять-семь ходовых цен, условия замера, главное правило доставки. Ограничение жёсткое, 1500 символов на все закреплённые записи вместе (лишнее обрезается, и это видно в логах). Так и задумано: закреплённое оплачивается в каждом сообщении, ровно как текст промпта.
Всё остальное, полный каталог, характеристики, регламенты, частые вопросы, должно искаться. Тогда за него платишь только тогда, когда оно понадобилось.
Проверь, что работает
В разделе есть «Тест поиска»: вводишь вопрос клиента → видишь, какие фрагменты база вернёт боту, из какого раздела документа они взяты и как нашлись: по словам, по смыслу или с поправкой на опечатку. Это ровно тот поиск, что бот делает на каждое сообщение. Если по важному вопросу ничего не находит, переформулируй контент или добавь похожий.
Плюс прогони реальные вопросы в Тест-чате: там в «технических деталях» видно, какие источники бот подтянул.
Управление записями
- Фильтры: Все / Активные / Неактивные, поиск по названию;
- Включить/выключить запись (выключенная не участвует в поиске);
- Скрепка «Всегда под рукой»: запись едет боту в каждом сообщении мимо поиска (см. выше);
- Массовые действия: включить/выключить/удалить выбранные;
- Большие документы система бьёт на фрагменты: их можно посмотреть и отредактировать.
Частые ошибки
| Симптом | Причина | Что делать |
|---|---|---|
| Бот не знает то, что я загрузил | Запись выключена или вопрос непохож на текст | Включи запись; проверь «Тест поиска», переформулируй контент |
| «Почти лимит» / не добавляется | Близко к 100 записям | Удали ненужные, объедини мелкие |
| Загрузил, но бот выдумывает | Факт есть в базе, но промпт не велит на неё опираться | В промпте: «цены и факты бери из базы знаний, не выдумывай» |
| Файл не грузится | Больше 4 МБ или не тот формат | Сократи / используй TXT, CSV, PDF, DOCX |
Вопросы, которые обычно возникают
Чем это отличается от промпта?
Промпт, поведение (всегда в каждом ответе). База знаний, факты (бот достаёт только релевантное под конкретный вопрос). Большие данные в промпте = дорого и бот путается.
Это платно?
Да, чуть-чуть: и индексация документа, и каждый поиск стоят примерно по 1¢ ($0.01). Поиск идёт на каждое сообщение, это учитывается в расходе.
Бот читает весь документ каждый раз?
Нет. Только самые подходящие фрагменты под текущий вопрос: столько, сколько влезает в 8 000 символов контекста (обычно от 3 до 15, зависит от размера кусков).
Под капотом
- RAG (Retrieval-Augmented Generation): документы режутся на чанки, для каждого считаются векторные embeddings. На каждое сообщение клиента идёт гибридный поиск: вектора (смысл) + полнотекстовый поиск с русской морфологией (точные слова) + триграммы (опечатки), результаты объединяются рангом. В контекст попадает столько лучших чанков, сколько помещается в 8 000 символов (не больше 15). Записи со «Всегда под рукой» подмешиваются без поиска, в пределах 1500 символов.
- Лимиты: 100 записей/проект (всего), до 1 000 000 символов при вставке текстом, из файла и URL извлекается до 500 000 (
MAX_EXTRACTED_LEN_KB/MAX_PAGE_SIZE), файл 4 МБ, в промпт идёт до 8 000 символов из 5 чанков. - Форматы: TXT, CSV, URL (с глубиной до 3 и автообновлением), PDF, DOCX. URL-скан: до 20 подстраниц, каждая = отдельная запись.
- Стоимость: ≈$0.01 индексация документа + ≈$0.01 за поиск (на каждое сообщение); минимальное списание за эмбеддинг, 1¢.
- Обновления списка идут в реальном времени (
use-realtime-kb). RAG это не функция, а внутренний шаг пайплайна; включать/вызывать не надо.
Простыми словами
База знаний это справочник твоего бизнеса для бота: цены, услуги, условия, частые вопросы. Ты загружаешь туда текст, документ или ссылку на сайт, а бот сам, на каждый вопрос клиента, достаёт оттуда нужный кусочек и отвечает точно, не выдумывая. Маленькие вещи (адрес, часы работы) проще написать прямо в инструкции бота, а вот большой прайс или список услуг: сюда. Есть кнопка «Тест поиска»: вводишь вопрос и видишь, что бот найдёт, удобно проверить, что он не промахнётся.
Дальше: → Дожимы
Связано: Системный промпт · Как бот думает · Тест-чат
Не получилось? → Бот не отвечает