Вплив параметрів текстових документів на точність роботи мультимодальної моделі GPT-4 vision у завданнях розпізнавання тексту

Ключові слова: частота появи галюцинацій, розпізнавання символів, цифровізація документів, великі мовні моделі

Анотація

Проаналізовано вплив параметрів текстових документів на ефективність мовної мультимодальної моделі GPT-4 Vision, яку активно застосовують для цифровізації документів зі складною структурою. Досліджено залежність точності роботи моделі від таких факторів, як розмір шрифту, фізичний розмір документа (кількість сторінок формату А4) та загальний обсяг тексту (кількість символів). Особливу увагу приділено проблемі генерування моделлю некоректної інформації ("галюцинацій"), яка залишається істотним недоліком цього підходу до цифровізації текстів. Розроблено п'ять експериментальних наборів PDF-документів із варіативними параметрами шрифту, обсягу тексту та кількості сторінок, що дало змогу оцінити вплив кожного з факторів окремо й у їхніх комбінаціях. Для кількісного оцінювання частоти появи галюцинацій застосовано метрику точності ROUGE-L. Встановлено, що частота виникнення галюцинацій значно зростає у документах, які містять понад 5000 символів тексту зі шрифтом в 14 pt або більш ніж дві сторінки формату А4. Наприклад, для чотиристорінкового документа з обсягом тексту близько 12000 символів значення метрики ROUGE-L становило 0,51, тоді як для аналогічного за обсягом тексту, компактно розташованого на одній сторінці за рахунок зменшення розміру шрифту до 6 pt, показник точності був значно вищим (ROUGE-L = 0,87). Це свідчить про значний вплив фізичних параметрів документа на точність роботи мультимодальних моделей. Розроблено практичні рекомендації щодо раціонального використання моделі GPT-4 Vision для цифровізації складних документів: мінімальний рекомендований розмір шрифту – 6 pt; максимальний обсяг тексту – до 5000 символів або не більше двох сторінок за одне оброблення; потреба мінімізації пустих ділянок шляхом видалення зайвих полів і порожніх сторінок. Отримані результати мають практичну цінність для подальшого вдосконалення алгоритмів цифровізації документів зі складною структурою та для підвищення надійності роботи мультимодальних моделей. Запропоновану методику оцінювання впливу параметрів текстових документів на точність роботи моделі GPT-4 Vision можна використати для наступного дослідження, спрямованого на зменшення частоти виникнення галюцинацій у завданнях автоматизованого розпізнавання тексту.

Завантаження

Дані завантаження ще не доступні.

Біографії авторів

Д. Я. Доскач, Національний університет "Львівська політехніка", м. Львів

аспірант, кафедра систем штучного інтелекту

В. М. Хавалко, Національний університет "Львівська політехніка", м. Львів

канд. техн. наук, доцент, кафедра систем штучного інтелекту, заступник директора з науково-педагогічної роботи інституту комп'ютерних наук

Посилання

Abdelaziz, T. A. I., & Fazil, U. (2023). Applications of integration of AI-based Optical Character Recognition (OCR) and Generative AI in Document Understanding and Processing. Applied Research in Artificial Intelligence and Cloud Computing, 6(11), 1–16. URL: https://researchberg.com/index.php/araic/article/view/171

Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F. L., & McGrew, B. (2023). Gpt-4 technical report. arXiv preprint. https://doi.org/10.48550/arXiv.2303.08774

Borchmann, Ł. (2024). Notes on applicability of gpt-4 to document understanding. arXiv preprint. https://doi.org/10.48550/arXiv.2405.18433

Cui, C., Zhou, Y., Yang, X., Wu, S., Zhang, L., Zou, J., & Yao, H. (2023). Holistic analysis of hallucination in gpt-4v (ision): Bias and interference challenges. arXiv preprint. https://doi.org/10.48550/arXiv.2311.03287

Ghiriti, A., Göderle, W., & Kern, R. (2024). Exploring the Capabilities of GPT-4 Vision as OCR Engine. In: Antonacopoulos, A., et al. Linking Theory and Practice of Digital Libraries. TPDL 2024. Lecture Notes in Computer Science, article ID 15178. Springer, Cham. https://doi.org/10.1007/978-3-031-72440-4_1

Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., Ishii, E., Bang, Y. J., Madotto, A., & Fung, P. (2023). Survey of hallucination in natural language generation. ACM Computing Surveys, 55(12), article ID 248. https://doi.org/10.1145/3571730

Lee, T., Kim, G., Ahn, H., Jeong, J., Jeong, M., & Song, J. (2024). Integrating OCR and LLMs for enhanced document digitization in ERP systems. Proceedings of the 15th International Conference on Information and Communication Technology Convergence (ICTC), 1650–1653. https://doi.org/10.1109/ICTC62082.2024.10827723

Lin, C.-Y. (2004). ROUGE: A package for automatic evaluation of summaries. In Proceedings of Workshop on Text Summarization Branches Out, Post-Conference Workshop of ACL 2004, Barcelona, Spain, 74–81. Association for Computational Linguistics. URL: https://aclanthology.org/W04-1013/

Lin, C.-Y., & Och, F. J. (2004). Automatic evaluation of machine translation quality using longest common subsequence and skip-bigram statistics. Annual Meeting of the Association for Computational Linguistics. https://doi.org/10.3115/1218955.1219032

OpenAI. (2023). GPT-4V (ision) system card. URL: https://openai.com/research/gpt-4-vision

Peña, A., Morales, A., Fierrez, J., Ortega-Garcia, J., Puente, I., Cordova, J., & Cordova, G. (2024). Continuous document layout analysis: Human-in-the-loop AI-based data curation, database, and evaluation in the domain of public affairs. Information Fusion, 108, article ID 102398. https://doi.org/10.1016/j.inffus.2024.102398

Raj, A., Kumar, S., Singh, P., & Patel, A. (2023). Revolutionizing data entry: An in-depth study of optical character recognition technology and its future potential. International Journal for Research in Applied Science and Engineering Technology, 2, 645–653. https://doi.org/10.22214/ijraset.2023.49108

Shi, Y., Peng, D., Liao, W., Lin, Z., Chen, X., Liu, C., & Jin, L. (2023). Exploring ocr capabilities of gpt-4v (ision): A quantitative and in-depth evaluation. arXiv preprint. https://doi.org/10.48550/arXiv.2310.16809

Ströbel, P. B., Clematide, S., Meyer, J., & Werner, P. (2024). New "ArchAIval" Practices: Using GPT for OCR and Historical Narration of Index Cards. In: Antonacopoulos, A., et al. Linking Theory and Practice of Digital Libraries. TPDL 2024. Lecture Notes in Computer Science, article ID 15178. Springer, Cham. https://doi.org/10.1007/978-3-031-72440-4_18

Wu, W., Yao, H., Zhang, M., Song, Y., Ouyang, W., & Wang, J. (2023). GPT4Vis: what can GPT-4 do for zero-shot visual recognition?. arXiv preprint. https://doi.org/10.48550/arXiv.2311.15732

Ye, J., Hu, A., Xu, H., Ye, Q., Yan, M., Xu, G., & Huang, F. (2023). Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model. arXiv preprint. https://doi.org/10.48550/arXiv.2310.05126

Zhang, J., Haverals, W., Naydan, M., & Kernighan, B. W. (2024). Post-OCR correction with OpenAI's GPT models on challenging English prosody texts. Proceedings of the ACM Symposium on Document Engineering 2024 (DocEng '24), 9, 1–4. https://doi.org/10.1145/3685650.3685669

Zhu, F., Liu, Z., Ng, X., Wu, H., Wang, W., Feng, F., Wang, C., Luan, H., & Chua, T. (2024). MMDocBench: Benchmarking large vision-language models for fine-grained visual document understanding. arXiv preprint. https://doi.org/10.48550/arXiv.2410.21311

Опубліковано
2025-05-02
Як цитувати
Доскач, Д. Я., & Хавалко, В. М. (2025). Вплив параметрів текстових документів на точність роботи мультимодальної моделі GPT-4 vision у завданнях розпізнавання тексту. Scientific Bulletin of UNFU, 35(2), 124-131. https://doi.org/10.36930/40350214
Розділ
Інформаційні технології