Контрольована реконструкція LLM-згенерованих синтетичних поведінкових даних для прогнозування повторної покупки клієнтом у CRM-системах

Ключові слова: машинне навчання, синтетичні дані, великі мовні моделі, управління взаємовідносинами із клієнтами, прогнозування поведінки користувачів, гібридне навчання моделі, модель Random Forest

Анотація

Проаналізовано можливості використання синтетичних даних, згенерованих великими мовними моделями LLM (англ. Large Language Model), для вирішення завдань прогнозування повторної покупки клієнтом у CRM-системах (англ. Customer Relationship Management – управління взаємовідносинами із клієнтами). Встановлено, що безпосереднє використання сирих LLM-згенерованих транзакційних даних є неприйнятним через явище колапсу на рівні користувачів: у сирих наборах даних фіксується тільки декілька сотень унікальних користувачів замість очікуваних десятків тисяч. Запропоновано методику контрольованої реконструкції LLM-згенерованих синтетичних транзакційних даних, який відокремлює правдоподібність окремих транзакцій від реалістичності поведінки користувачів на агрегованому рівні. Розроблено процедуру реконструкції синтетичних даних, що перепризначає транзакції новим синтетичним користувачам відповідно до емпіричних розподілів кількості транзакцій, отриманих із реальних даних. Досліджено чотири напрями оцінювання синтетичних даних: REAL→REAL, LLM_REBUILT→REAL, REAL→LLM_REBUILT та REAL+LLM_REBUILT→REAL – з використанням часового поділу та без витоку даних. Застосовано модель Random Forest як основну модель та моделі XGBoost і LightGBM – для оцінювання робастності отриманих результатів та підтвердження відтворюваності висновків. З'ясовано, що реконструйовані синтетичні дані частково зберігають поведінковий сигнал, проте не відтворюють повністю реальну купівельну поведінку на рівні користувачів. Встановлено, що синтетичні дані краще зберігають монетарні закономірності, ніж часову поведінкову динаміку. Підтверджено, що гібридне навчання моделі на реальних і реконструйованих синтетичних даних покращує якість прогнозування поведінки користувачів порівняно з навчанням моделі тільки на синтетичних даних. Охарактеризовано контрольовану реконструкцію LLM-згенерованих синтетичних даних як перспективну стратегію доповнення реальних поведінкових даних у завданнях CRM-прогнозування, яку, водночас, не можна розглядати як їх повну заміну.

Завантаження

Дані завантаження ще не доступні.

Біографії авторів

К. О. Тєлєгін, Житомирський державний університет імені Івана Франка, м. Житомир

аспірант, кафедра комп'ютерних наук та інформаційних технологій

Я. В. Лавренюк, Житомирський державний університет імені Івана Франка, м. Житомир

д-р фіз.-мат. наук, ст. наук. співробітник, професор, кафедра комп'ютерних наук та інформаційних технологій

Посилання

Bobadilla, J., Gutiérrez, A., Yera, R., & Martínez, L. (2023). Creating synthetic datasets for collaborative filtering recommender systems using generative adversarial networks. Knowledge-Based Systems, 280, article ID 111016. https://doi.org/10.1016/j.knosys.2023.111016

Borisov, V., Seßler, K., Leemann, T., Pawelczyk, M., & Kasneci, G. (2023). Language models are realistic tabular data generators. In Proceedings of the 11th International Conference on Learning Representations (ICLR 2023). https://doi.org/10.48550/arXiv.2210.06280

DSouza, A., Swetha, M., & Sarawagi, S. (2025). Synthetic tabular data generation for imbalanced classification: The surprising effectiveness of an overlap class. Proceedings of the AAAI Conference on Artificial Intelligence, 39(15), 16127–16134. https://doi.org/10.1609/aaai.v39i15.33725

Figueira, A., & Vaz, B. (2022). Survey on synthetic data generation, evaluation methods and GANs. Mathematics, 10(15), article ID 2733. https://doi.org/10.3390/math10152733

Fonseca, J., & Bacao, F. (2023). Tabular and latent space synthetic data generation: A literature review. Journal of Big Data, 10, article ID 115. https://doi.org/10.1186/s40537-023-00792-7

Gorishniy, Y., Rubachev, I., Khrulkov, V., & Babenko, A. (2021). Revisiting deep learning models for tabular data. Advances in Neural Information Processing Systems, 34, 18932–18943. https://doi.org/10.48550/arXiv.2106.11959

Grinsztajn, L., Oyallon, E., & Varoquaux, G. (2022). Why do tree-based models still outperform deep learning on typical tabular data? Advances in Neural Information Processing Systems, 35, 507–520. https://doi.org/10.48550/arXiv.2207.08815

Kotelnikov, A., Baranchuk, D., Rubachev, I., & Babenko, A. (2023). TabDDPM: Modelling tabular data with diffusion models. In Proceedings of the 40th International Conference on Machine Learning (ICML 2023). PMLR. https://doi.org/10.48550/arXiv.2209.15421

Kurakova, A., & Homayouni, H. (2025). A comprehensive evaluation framework for synthetic medical tabular data generation. Journal of Biomedical Informatics, 163, article ID 104939. https://doi.org/10.1016/j.jbi.2025.104939

Lautrup, A. D., Hyrup, T., Zimek, A., & Schneider-Camp, P. (2024). Systematic review of generative modelling tools and utility metrics for fully synthetic tabular data. ACM Computing Surveys, 57(4), article ID 90. https://doi.org/10.1145/3704437

Rungruang, C., Riyapan, P., Intarasit, A., Chuarkham, K., & Muangprathub, J. (2024). RFM model customer segmentation based on hierarchical approach using FCA. Expert Systems with Applications, 237, article ID 121449. https://doi.org/10.1016/j.eswa.2023.121449

Sujon, K. M., Islam, M. A., & Rahman, M. M. (2025). Accuracy, precision, recall, f1-score, or MCC? Empirical evidence from advanced statistics, ML, and XAI for evaluating business predictive models. Journal of Big Data, 12, article ID 268. https://doi.org/10.1186/s40537-025-01313-4

Sun, Y., Liu, H., & Gao, Y. (2023). Research on customer lifetime value based on machine learning algorithms and customer relationship management analysis model. Heliyon, 9(2), article ID e13384. https://doi.org/10.1016/j.heliyon.2023.e13384

Verma, R., Rathor, D., Kumar, S., Mishra, M., & Baranwal, M. (2025). Enhancing customer repurchase prediction: Integrating classification algorithms with RFM analysis for precision and actionable insights. IIMB Management Review, 37(2), article ID 100574. https://doi.org/10.1016/j.iimb.2025.100574

Zhang, H., Zhang, J., Srinivasan, B., Shen, Z., Qin, X., Faloutsos, C., Rangwala, H., & Karypis, G. (2024). Mixed-type tabular data synthesis with score-based diffusion in latent space. In Proceedings of the 12th International Conference on Learning Representations (ICLR 2024). https://doi.org/10.48550/arXiv.2310,09656

Опубліковано
2026-09-24
Як цитувати
Тєлєгін, К. О., & Лавренюк, Я. В. (2026). Контрольована реконструкція LLM-згенерованих синтетичних поведінкових даних для прогнозування повторної покупки клієнтом у CRM-системах. Scientific Bulletin of UNFU, 36(4), 114–120. https://doi.org/10.36930/40360413
Розділ
Комп’ютерні науки