Сколько стоит превратить Telegram-чаты в базу знаний для ИИ
Разбор эксперимента с 96 386 сообщениями: подготовка корпуса, векторный поиск, проверка Telegram-ссылок и почему цена ответа важнее стоимости индекса.
Человек 2.0Что забрать из статьи
- 1Подготовка большого корпуса может стоить недорого; основные расходы начинаются на ежедневных ответах.
- 2Качество нужно проверять на реальных сценариях и валидности каждой ссылки на источник.
- 3Цены и названия моделей быстро меняются — сохраняйте методику сравнения, а не старый прайс.
Два больших Telegram-чата можно превратить в базу знаний дешевле обычного обеда. Дороже становится ежедневная работа модели.
В исходном эксперименте обработали 96 386 сообщений: очистили корпус, сохранили даты, ветки ответов и ссылки, затем построили векторный индекс.

Подготовка корпуса — не главный расход
На момент эксперимента 9,66 млн токенов эмбеддингов обошлись примерно в 1,26 доллара, а подготовительный этап с первичными проверками — около 1,40 доллара. Это исторический срез, а не текущий тариф.
Как сравнивали модели
- Одинаковый найденный контекст для всех моделей.
- Десять реальных сценариев, включая вопрос без ответа.
- Слепая оценка без названий моделей.
- Повтор с обратным порядком ответов.
- Отдельная проверка каждой Telegram-ссылки.
Смысл такого теста — не выбрать вечного победителя, а найти баланс качества, скорости и цены для конкретного корпуса.
Что измерять в production
Следите за долей ответов с валидными источниками, корректными отказами, задержкой и ценой одного запроса. Векторный поиск обычно дешевле генерации ответа.

Описание самого бота по Данангу.Открыть кейс