[Перевод] Улучшенный векторный поиск по длинным документам: чанкинг внутри Manticore Search
Habr ·
![[Перевод] Улучшенный векторный поиск по длинным документам: чанкинг внутри Manticore Search](https://habrastorage.org/getpro/habr/upload_files/809/3c1/531/8093c153120360e7ce9471ebd43ac2fc.jpg)
Модель эмбеддингов читает только первые несколько сотен токенов документа, а остальное молча отбрасывает. Теперь Manticore Search сам разбивает длинные документы при INSERT: добавьте chunk_strategy к векторному столбцу и выберите одну из пяти стратегий. Без конвейера загрузки и библиотек для разбиения текста. На нашей документации recall@5 для текста за пределами окна модели вырос с 55% до 83%. Читать далее
Модель эмбеддингов читает только первые несколько сотен токенов документа, а остальное молча отбрасывает. Теперь Manticore Search сам разбивает длинные документы при INSERT: добавьте chunk_strategy к векторному столбцу и выберите одну из пяти стратегий. Без конвейера загрузки и библиотек для разбиения текста. На нашей документации recall@5 для текста за пределами окна модели вырос с 55% до 83%. Читать далее