Ефективність застосування методів класифікації для задач інтелектуального аналізу великих даних
Анотація
Проаналізовано ефективність застосування методів класифікації для задач інтелектуального аналізу великих даних на підставі концепції машинного навчання задля підвищення їхньої ефективності у сфері електронної комерції. Проведено порівняльний аналіз застосування таких моделей, як класифікатор методом випадкового лісу (англ. Random Forest), класифікатор методом наївного Байєса (англ. Naïve Bayes) та класифікатор методом опорних векторів (англ. Support Vector Machines, SVM), який також називають опорно-векторними мережами (англ. Support Vector Networks, SVN). Для поширеної у сфері електронної комерції задачі класифікації клієнтів розроблено програмне забезпечення для проведення аналізу відповідних алгоритмів. Проаналізовано вхідні дані і здійснено попередню підготовку даних для навчання та тестування вибраних моделей. Здійснено дослідження обраних моделей із використанням попередньо підготовлених даних за допомогою програмного забезпечення відповідно до визначених сценаріїв. Досліджено параметри обраних моделей класифікації та вдосконалено класифікатор методом випадкового лісу шляхом підбору та зміни параметра випадкового стану. Також впроваджено параметри підтримки ймовірностей у класифікаторі методом опорних векторів. Здійснено із використанням попередньо підготовлених даних дослідження обраних моделей за допомогою програмного забезпечення відповідно до визначених сценаріїв. Впроваджено параметру підтримки ймовірностей у класифікаторі методом опорних векторів. Здійснено порівняння результату точності класифікації обраних моделей класифікації. Згідно з результатами дослідження, визначено позитивний тренд на якість навчання моделей за коректної підготовки даних і впливу підбору коректних параметрів для класифікаторів методами випадкового лісу й опорних векторів. Показники ефективності, точності навчання алгоритму показують позитивну динаміку й порівняно із результатами тестування моделі класифікатора методом наївного Байєса базовими значеннями параметрів моделі. На підставі результатів дослідження підтверджується вплив підбору коректних параметрів залежно від вхідного набору даних на результати точності передбачення алгоритмів і їх вплив на навчання, тренування та тестування моделей машинного навчання. Ці результати свідчать про перспективи до подальшого дослідження щодо розроблення оптимальних стратегій оптимізації та підвищення ефективності щодо роботи з алгоритмами машинного навчання у задачах класифікації.
Завантаження
Посилання
Avcı, C., Budak, M., Yağmur, N., & Balçık, F. (2023). Comparison between random forest and support vector machine algorithms for LULC classification. International Journal of Engineering and Geosciences, 8(1). https://doi.org/10.26833/ijeg.987605
Dai, H.-N., Wang, H., Xu, G., Wan, J., Imran, M., Dai, H.-N., & Xu, G. (2019). Big Data Analytics for Manufacturing Internet of Things: Opportunities, Challenges and Enabling Technologies. Enterprise Information Systems, 14. https://doi.org/10.1080/17517575.2019.1633689
Deng, R. (2022). Research on value mining of management accounting non-financial data based on association rules algorithm. In: 2022 2nd International Conference on Networking, Communications and Information Technology (NetCIT), Manchester, United Kingdom, 175–178. https://doi.org/10.1109/NetCIT57419.2022.00051
H. J. V. L., & Rajan, D. (2023). Enhancing customer experience and sales performance in a retail store using association rule mining and market basket analysis. In: 2023 14th International Conference on Computing Communication and Networking Technologies (ICCCNT), Delhi, India, 1–5. https://doi.org/10.1109/ICCCNT56998.2023.10307411
Hammoumi, L., Maanan, M., & Rhinane, H. (2024). Characterizing Smart Cities Based on Artificial Intelligence. Smart Cities, 7(3). https://doi.org/10.3390/smartcities7030056
Hastie, T., Tibshirani, R., & Friedman, J. (n.d.). The elements of statistical learning: Data mining, inference, and prediction. URL: https://web.stanford.edu/~hastie/ElemStatLearn/
Horohovatskyi, V. O., & Tvoroshenko, I. S. (2021). Methods of intellectual analysis and data processing. URL: https://openarchive.nure.ua/handle/document/15868
Ikegwu, A., Nweke, H., Anikwe, C., Alo, U., & Okonkwo, O. (2022). Big data analytics for data-driven industry: A review of data sources, tools, challenges, solutions, and research directions. Cluster Computing, 25, 3343–3387. https://doi.org/10.1007/s10586-022-03568-5
Kaggle. (2023). Airline passenger satisfaction. URL: https://www.kaggle.com/datasets/teejmahal20/airline-passenger-satisfaction
Kalinina, Iryna, & Gozhyj, Alexander. (2021). Study of the efficiency of classification methods in forecasting in machine learning tasks. Management of Development of Complex Systems, 46, 173–180. https://doi.org/10.32347/2412-9933.2021.46.173-180
Keskar, V., Yadav, J., & Kumar, A. (2022). Perspective of anomaly detection in big data for data quality improvement. Materials Today: Proceedings, 51, 532–537. https://doi.org/10.1016/j.matpr.2021.06.145
Kumar, A., Kalia, P., & Mann, B. S. (2020). Utilization of big data in e-commerce business. Journal of Information and Optimization Sciences, 41(6), 1391–1401. https://doi.org/10.1080/02522667.2020.1794434
L'Heureux, A., Grolinger, K., El Yamany, H., & Capretz, M. (2017). Machine Learning With Big Data: Challenges and Approaches, 5, 7776–7797. https://doi.org/10.1109/ACCESS.2017.2696365
Li, H. J., & Yang, D. X. (2006). Study on data mining and its application in e-business. Journal of Gansu Lianhe University (Natural Science), 20(6), 30–33. URL: https://core.ac.uk/download/pdf/11784915.pdf
Musleh, D., Alkhwaja, A., Alkhwaja, I., Alghamdi, M., Abahussain, H., Albugami, M., Alfawaz, F., El-Ashker, S., & Al-Hariri, M. (2024). Machine Learning Approaches for Predicting Risk of Cardiometabolic Disease among University Students. Big Data and Cognitive Computing, 8(3). https://doi.org/10.3390/bdcc8030031
Natchiar, S. U., & Baulkani, S. (2014). Customer relationship management classification using data mining techniques. In: 2014 International Conference on Science Engineering and Management Research (ICSEMR), Chennai, India, 1–5. https://doi.org/10.1109/ICSEMR.2014.7043662
Nti, I., Quarcoo, J., Fosu, G., & Aning, J. (2022). A Mini-Review of Machine Learning in Big Data Analytics: Applications, Challenges, and Prospects. Big Data Mining and Analytics, 5, 81–97. https://doi.org/10.26599/BDMA.2021.9020028
Painuly, S., Sharma, S., & Matta, P. (2021). Big data driven e-commerce application management system. In: 2021 6th International Conference on Communication and Electronics Systems (ICCES), Coimbatore, India, 1–5. https://doi.org/10.1109/ICCES51350.2021.9489108
Pan, W., Washizaki, H., Yoshioka, N., Fukazawa, Y., Khomh, F., & Guéhéneuc, Y. (2023). A machine learning based approach to detect machine learning design patterns. In: 2023 30th Asia-Pacific Software Engineering Conference (APSEC), Seoul, Korea, Republic of, 574–578. https://doi.org/10.1109/APSEC60848.2023.00073
Petryna, V. V., Doroshenko, A. V., Sydorenko, R. V., & Teslyuk, V. M. (2023). Model and means of data collection and processing using machine learning. Scientific Bulletin of UNFU, 33(3), 102–109. https://doi.org/10.36930/40330315
Raghavan, S. N. R. (2005). Data mining in e-commerce: A survey. Sadhana, 30, 275–289. https://doi.org/10.1007/BF02706248
Rao, T. R., Mitra, P., Bhatt, R., & Goswami, A. (2019). The big data system, components, tools, and technologies: A survey. Knowledge and Information Systems, 60(3), 1165–1245. https://doi.org/10.1007/s10115-018-1248-0
Raschka, S., & Mirjalili, V. (2019). Python machine learning. URL: https://www.w3schools.com/python/python_ml_getting_started.asp
Subach, I., & Mykytiuk, A. (2023). The method pf forming associative rules from the SIEM database – systems based on the theory of fuzzy sets and linguistic terms. Electronic professional scientific publication "Cybersecurity: education, science, technology", 3(19). https://doi.org/10.28925/2663-4023.2023.19.2033
Teslyuk, V., Doroshenko, A., & Savchuk, D. (2023). Intelligent Methods and Models for Assessing Level of Student Adaptation to Online Learning https://www.scopus.com/authid/detail.uri?authorId=57202210835
Turban, E., Whiteside, J., King, D., & Outland, J. (2017). Introduction to electronic commerce and social commerce. Springer Link. https://doi.org/10.1007/978-3-319-50091-1
Uncertainty Based Under-Sampling for Learning Naive Bayes Classifiers Under Imbalanced Data Sets, IEEE Journals & Magazine, IEEE Xplore. (n.d.). (2024). URL: https://ieeexplore.ieee.org/document/8939418
Xu, X., Jia, L., Wang, Z., Zhang, H., Liang, S., & Zhou, C. (2005). Fast algorithm for mining item profit in retails based on microeconomic view. In: 2005 International Conference on Cyberworlds (CW'05), Singapore, 353. https://doi.org/10.1109/CW.2005.44



