Смарт-система семантичного пошуку текстових даних

  • П. А. Кок Національний університет "Львівська політехніка", м. Львів
  • А. Є. Батюк Національний університет "Львівська політехніка", м. Львів https://orcid.org/0000-0001-7650-7383
Ключові слова: векторизація тексту, векторні ембединги, RAG-архітектура, векторний індекс, гібридна модель пошуку, ранжування

Анотація

Розроблено смарт-систему семантичного пошуку текстових даних, що застосовує сучасні методи векторного подання тексту та орієнтована на роботу з великими масивами неструктурованої інформації. У роботі реалізовано комплексний підхід, який поєднує глибоку векторизацію тексту, побудову високопродуктивного індексу та оркестрацію пошукових запитів за допомогою технологій LangChain, LangGraph, PostgreSQL та Pinecone. Проведено повний цикл дослідження: підготовку набору даних, очищення та нормалізацію текстових документів, автоматизований поділ на чанки відповідного розміру для підвищення якості ембедингів, побудова векторного індексу та виконання пошуку за різними типами запитів користувача. Окрему увагу приділено вимірюванню продуктивності великої мовної моделі, зокрема – тривалості відповіді, стабільності за навантаження та точності рекомендацій із використанням метрик Recall@k, MRR і nDCG. Інтегровано підсистеми кешування (Redis) і спостереження (LangSmith), що забезпечують додаткову стійкість до пікових навантажень та полегшують аналіз роботи моделей. Отримані результати демонструють істотне зменшення середньої тривалості пошуку (до 120 мс) і приріст релевантності приблизно на 15 % порівняно з класичними алгоритмами на кшталт BM25. Запропоновано гібридну модель, що комбінує семантичний векторний пошук текстових даних із процедурою їхнього ранжування, завдяки чому підвищується точність пошуку у доменах із високою варіативністю формулювань. Практична цінність роботи полягає у можливості інтеграції системи в корпоративні бази знань, у служби підтримки прийняття рішень, в освітні платформи та бібліотечні інформаційні системи. Запропоновані підходи сприяють подальшому розвитку інструментів семантичного пошуку та відкривають перспективи вдосконалення методів векторизації тексту, оптимізації індексації та розширення застосувань у RAG-архітектурах і мультиагентних системах.

Завантаження

Дані завантаження ще не доступні.

Біографії авторів

П. А. Кок, Національний університет "Львівська політехніка", м. Львів

магістрант, кафедра автоматизованих систем управління

А. Є. Батюк, Національний університет "Львівська політехніка", м. Львів

канд. техн. наук, доцент, кафедра автоматизованих систем управління

Посилання

Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In: Proceedings of NAACL-HLT 2019, (pp. 2–16). URL: https://aclanthology.org/N19-1423/

Järvelin, K., & Kekäläinen, J. (2002). Cumulated Gain-Based Evaluation of IR Techniques. ACM Transactions on Information Systems, 20(4), 422–446. https://doi.org/10.1145/582415.582418

Johnson, J., Douze, M., & Jégou, H. (2017). Billion-scale Similarity Search with FAISS. IEEE Transactions on Big Data, (pp. 1–3). URL: https://faiss.ai/

Karpukhin, V., et al. (2020). Dense Passage Retrieval for Open-Domain Question Answering. In: Proceedings of EMNLP 2020 (pp. 6769–6781). URL: https://aclanthology.org/2020.emnlp-main.550.pdf

Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. In NeurIPS 2020, (pp. 1–16). URL: https://proceedings.neurips.cc/paper/2020/file/6b493230205f780e1bc26945df7481e5-Paper.pdf

Mikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient Estimation of Word Representations in Vector Space. arXiv:1301.3781, (pp. 1–12). URL: https://arXiv.org/pdf/1301.3781.pdf

Min, S., & Jurafsky, D. (2020). Training and Evaluating Embedding Models for NLP. Stanford NLP Notes. URL: https://web.stanford.edu/class/cs224n/

Palmer, D. D. (1997). Text Segmentation. In Encyclopedia of Language and Linguistics. Elsevier, (pp. 1–8). URL: Proceedings of https://dl.acm.org/doi/pdf/10.3115/976909.979658

Pennington, J., Socher, R., & Manning, C. D. (2014). GloVe: Global Vectors for Word Representation. In: Proceedings of EMNLP 2014, (pp. 1–12). URL: https://aclanthology.org/D14-1162.pdf

PostgreSQL Global Development Group. (2024). Indexes and Index Types. URL: https://www.postgresql.org/docs/current/indexes.html

Reimers, N., & Gurevych, I. (2019). Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. In: Proceedings of EMNLP 2019, (pp. 1–12). URL: https://arXiv.org/abs/1908.10084

Robertson, S. E. (2004). Understanding Inverse Document Frequency: On Theoretical Arguments for IDF. Journal of Documentation, 60(5), 503–520. https://doi.org/10.1108/00220410410560582

Robertson, S., & Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. https://doi.org/10.1561/1500000019

Voorhees, E. M. (1999). The TREC-8 Question Answering Track. In: Proceedings of TREC-8. National Institute of Standards and Technology. URL: https://trec.nist.gov/pubs/trec8/papers/qa_report.pdf

Zeng, D., & Chen, M. (2021). Query Normalisation Techniques in Vector Search Systems. Milvus Research Notes. URL: https://milvus.io/

Опубліковано
2025-12-22
Як цитувати
Кок, П. А., & Батюк, А. Є. (2025). Смарт-система семантичного пошуку текстових даних. Scientific Bulletin of UNFU, 35(6), 70–75. https://doi.org/10.36930/40350608
Розділ
Інформаційні технології

Статті цього автора (авторів), які найбільше читають