Контрольована реконструкція LLM-згенерованих синтетичних поведінкових даних для прогнозування повторної покупки клієнтом у CRM-системах
Анотація
Проаналізовано можливості використання синтетичних даних, згенерованих великими мовними моделями LLM (англ. Large Language Model), для вирішення завдань прогнозування повторної покупки клієнтом у CRM-системах (англ. Customer Relationship Management – управління взаємовідносинами із клієнтами). Встановлено, що безпосереднє використання сирих LLM-згенерованих транзакційних даних є неприйнятним через явище колапсу на рівні користувачів: у сирих наборах даних фіксується тільки декілька сотень унікальних користувачів замість очікуваних десятків тисяч. Запропоновано методику контрольованої реконструкції LLM-згенерованих синтетичних транзакційних даних, який відокремлює правдоподібність окремих транзакцій від реалістичності поведінки користувачів на агрегованому рівні. Розроблено процедуру реконструкції синтетичних даних, що перепризначає транзакції новим синтетичним користувачам відповідно до емпіричних розподілів кількості транзакцій, отриманих із реальних даних. Досліджено чотири напрями оцінювання синтетичних даних: REAL→REAL, LLM_REBUILT→REAL, REAL→LLM_REBUILT та REAL+LLM_REBUILT→REAL – з використанням часового поділу та без витоку даних. Застосовано модель Random Forest як основну модель та моделі XGBoost і LightGBM – для оцінювання робастності отриманих результатів та підтвердження відтворюваності висновків. З'ясовано, що реконструйовані синтетичні дані частково зберігають поведінковий сигнал, проте не відтворюють повністю реальну купівельну поведінку на рівні користувачів. Встановлено, що синтетичні дані краще зберігають монетарні закономірності, ніж часову поведінкову динаміку. Підтверджено, що гібридне навчання моделі на реальних і реконструйованих синтетичних даних покращує якість прогнозування поведінки користувачів порівняно з навчанням моделі тільки на синтетичних даних. Охарактеризовано контрольовану реконструкцію LLM-згенерованих синтетичних даних як перспективну стратегію доповнення реальних поведінкових даних у завданнях CRM-прогнозування, яку, водночас, не можна розглядати як їх повну заміну.
Завантаження
Посилання
Bobadilla, J., Gutiérrez, A., Yera, R., & Martínez, L. (2023). Creating synthetic datasets for collaborative filtering recommender systems using generative adversarial networks. Knowledge-Based Systems, 280, article ID 111016. https://doi.org/10.1016/j.knosys.2023.111016
Borisov, V., Seßler, K., Leemann, T., Pawelczyk, M., & Kasneci, G. (2023). Language models are realistic tabular data generators. In Proceedings of the 11th International Conference on Learning Representations (ICLR 2023). https://doi.org/10.48550/arXiv.2210.06280
DSouza, A., Swetha, M., & Sarawagi, S. (2025). Synthetic tabular data generation for imbalanced classification: The surprising effectiveness of an overlap class. Proceedings of the AAAI Conference on Artificial Intelligence, 39(15), 16127–16134. https://doi.org/10.1609/aaai.v39i15.33725
Figueira, A., & Vaz, B. (2022). Survey on synthetic data generation, evaluation methods and GANs. Mathematics, 10(15), article ID 2733. https://doi.org/10.3390/math10152733
Fonseca, J., & Bacao, F. (2023). Tabular and latent space synthetic data generation: A literature review. Journal of Big Data, 10, article ID 115. https://doi.org/10.1186/s40537-023-00792-7
Gorishniy, Y., Rubachev, I., Khrulkov, V., & Babenko, A. (2021). Revisiting deep learning models for tabular data. Advances in Neural Information Processing Systems, 34, 18932–18943. https://doi.org/10.48550/arXiv.2106.11959
Grinsztajn, L., Oyallon, E., & Varoquaux, G. (2022). Why do tree-based models still outperform deep learning on typical tabular data? Advances in Neural Information Processing Systems, 35, 507–520. https://doi.org/10.48550/arXiv.2207.08815
Kotelnikov, A., Baranchuk, D., Rubachev, I., & Babenko, A. (2023). TabDDPM: Modelling tabular data with diffusion models. In Proceedings of the 40th International Conference on Machine Learning (ICML 2023). PMLR. https://doi.org/10.48550/arXiv.2209.15421
Kurakova, A., & Homayouni, H. (2025). A comprehensive evaluation framework for synthetic medical tabular data generation. Journal of Biomedical Informatics, 163, article ID 104939. https://doi.org/10.1016/j.jbi.2025.104939
Lautrup, A. D., Hyrup, T., Zimek, A., & Schneider-Camp, P. (2024). Systematic review of generative modelling tools and utility metrics for fully synthetic tabular data. ACM Computing Surveys, 57(4), article ID 90. https://doi.org/10.1145/3704437
Rungruang, C., Riyapan, P., Intarasit, A., Chuarkham, K., & Muangprathub, J. (2024). RFM model customer segmentation based on hierarchical approach using FCA. Expert Systems with Applications, 237, article ID 121449. https://doi.org/10.1016/j.eswa.2023.121449
Sujon, K. M., Islam, M. A., & Rahman, M. M. (2025). Accuracy, precision, recall, f1-score, or MCC? Empirical evidence from advanced statistics, ML, and XAI for evaluating business predictive models. Journal of Big Data, 12, article ID 268. https://doi.org/10.1186/s40537-025-01313-4
Sun, Y., Liu, H., & Gao, Y. (2023). Research on customer lifetime value based on machine learning algorithms and customer relationship management analysis model. Heliyon, 9(2), article ID e13384. https://doi.org/10.1016/j.heliyon.2023.e13384
Verma, R., Rathor, D., Kumar, S., Mishra, M., & Baranwal, M. (2025). Enhancing customer repurchase prediction: Integrating classification algorithms with RFM analysis for precision and actionable insights. IIMB Management Review, 37(2), article ID 100574. https://doi.org/10.1016/j.iimb.2025.100574
Zhang, H., Zhang, J., Srinivasan, B., Shen, Z., Qin, X., Faloutsos, C., Rangwala, H., & Karypis, G. (2024). Mixed-type tabular data synthesis with score-based diffusion in latent space. In Proceedings of the 12th International Conference on Learning Representations (ICLR 2024). https://doi.org/10.48550/arXiv.2310,09656

Ця робота ліцензується відповідно до Creative Commons Attribution 4.0 International License.



