Ефективність застосування методів класифікації для задач інтелектуального аналізу великих даних

  • В. В. Петрина Національний університет "Львівська політехніка", м. Львів
  • А. В. Дорошенко Національний університет "Львівська політехніка", м. Львів https://orcid.org/0000-0002-7214-5108
Ключові слова: електронна комерція, великі дані, інтелектуальний аналіз даних, класифікація, випадковий ліс, метод опорних векторів, класифікатор методом наївного Байєса

Анотація

Проаналізовано ефективність застосування методів класифікації для задач інтелектуального аналізу великих даних на підставі концепції машинного навчання задля підвищення їхньої ефективності у сфері електронної комерції. Проведено порівняльний аналіз застосування таких моделей, як класифікатор методом випадкового лісу (англ. Random Forest), класифікатор методом наївного Байєса (англ. Naïve Bayes) та класифікатор методом опорних векторів (англ. Support Vector Machines, SVM), який також називають опорно-векторними мережами (англ. Support Vector Networks, SVN). Для поширеної у сфері електронної комерції задачі класифікації клієнтів розроблено програмне забезпечення для проведення аналізу відповідних алгоритмів. Проаналізовано вхідні дані і здійснено попередню підготовку даних для навчання та тестування вибраних моделей. Здійснено дослідження обраних моделей із використанням попередньо підготовлених даних за допомогою програмного забезпечення відповідно до визначених сценаріїв. Досліджено параметри обраних моделей класифікації та вдосконалено класифікатор методом випадкового лісу шляхом підбору та зміни параметра випадкового стану. Також впроваджено параметри підтримки ймовірностей у класифікаторі методом опорних векторів. Здійснено із використанням попередньо підготовлених даних дослідження обраних моделей за допомогою програмного забезпечення відповідно до визначених сценаріїв. Впроваджено параметру підтримки ймовірностей у класифікаторі методом опорних векторів. Здійснено порівняння результату точності класифікації обраних моделей класифікації. Згідно з результатами дослідження, визначено позитивний тренд на якість навчання моделей за коректної підготовки даних і впливу підбору коректних параметрів для класифікаторів методами випадкового лісу й опорних векторів. Показники ефективності, точності навчання алгоритму показують позитивну динаміку й порівняно із результатами тестування моделі класифікатора методом наївного Байєса базовими значеннями параметрів моделі. На підставі результатів дослідження підтверджується вплив підбору коректних параметрів залежно від вхідного набору даних на результати точності передбачення алгоритмів і їх вплив на навчання, тренування та тестування моделей машинного навчання. Ці результати свідчать про перспективи до подальшого дослідження щодо розроблення оптимальних стратегій оптимізації та підвищення ефективності щодо роботи з алгоритмами машинного навчання у задачах класифікації.

Завантаження

Дані завантаження ще не доступні.

Біографії авторів

В. В. Петрина, Національний університет "Львівська політехніка", м. Львів

аспірант, кафедра автоматизованих систем управління

А. В. Дорошенко, Національний університет "Львівська політехніка", м. Львів

канд. техн. наук, доцент, кафедра автоматизованих систем управління

Посилання

Avcı, C., Budak, M., Yağmur, N., & Balçık, F. (2023). Comparison between random forest and support vector machine algorithms for LULC classification. International Journal of Engineering and Geosciences, 8(1). https://doi.org/10.26833/ijeg.987605

Dai, H.-N., Wang, H., Xu, G., Wan, J., Imran, M., Dai, H.-N., & Xu, G. (2019). Big Data Analytics for Manufacturing Internet of Things: Opportunities, Challenges and Enabling Technologies. Enterprise Information Systems, 14. https://doi.org/10.1080/17517575.2019.1633689

Deng, R. (2022). Research on value mining of management accounting non-financial data based on association rules algorithm. In: 2022 2nd International Conference on Networking, Communications and Information Technology (NetCIT), Manchester, United Kingdom, 175–178. https://doi.org/10.1109/NetCIT57419.2022.00051

H. J. V. L., & Rajan, D. (2023). Enhancing customer experience and sales performance in a retail store using association rule mining and market basket analysis. In: 2023 14th International Conference on Computing Communication and Networking Technologies (ICCCNT), Delhi, India, 1–5. https://doi.org/10.1109/ICCCNT56998.2023.10307411

Hammoumi, L., Maanan, M., & Rhinane, H. (2024). Characterizing Smart Cities Based on Artificial Intelligence. Smart Cities, 7(3). https://doi.org/10.3390/smartcities7030056

Hastie, T., Tibshirani, R., & Friedman, J. (n.d.). The elements of statistical learning: Data mining, inference, and prediction. URL: https://web.stanford.edu/~hastie/ElemStatLearn/

Horohovatskyi, V. O., & Tvoroshenko, I. S. (2021). Methods of intellectual analysis and data processing. URL: https://openarchive.nure.ua/handle/document/15868

Ikegwu, A., Nweke, H., Anikwe, C., Alo, U., & Okonkwo, O. (2022). Big data analytics for data-driven industry: A review of data sources, tools, challenges, solutions, and research directions. Cluster Computing, 25, 3343–3387. https://doi.org/10.1007/s10586-022-03568-5

Kaggle. (2023). Airline passenger satisfaction. URL: https://www.kaggle.com/datasets/teejmahal20/airline-passenger-satisfaction

Kalinina, Iryna, & Gozhyj, Alexander. (2021). Study of the efficiency of classification methods in forecasting in machine learning tasks. Management of Development of Complex Systems, 46, 173–180. https://doi.org/10.32347/2412-9933.2021.46.173-180

Keskar, V., Yadav, J., & Kumar, A. (2022). Perspective of anomaly detection in big data for data quality improvement. Materials Today: Proceedings, 51, 532–537. https://doi.org/10.1016/j.matpr.2021.06.145

Kumar, A., Kalia, P., & Mann, B. S. (2020). Utilization of big data in e-commerce business. Journal of Information and Optimization Sciences, 41(6), 1391–1401. https://doi.org/10.1080/02522667.2020.1794434

L'Heureux, A., Grolinger, K., El Yamany, H., & Capretz, M. (2017). Machine Learning With Big Data: Challenges and Approaches, 5, 7776–7797. https://doi.org/10.1109/ACCESS.2017.2696365

Li, H. J., & Yang, D. X. (2006). Study on data mining and its application in e-business. Journal of Gansu Lianhe University (Natural Science), 20(6), 30–33. URL: https://core.ac.uk/download/pdf/11784915.pdf

Musleh, D., Alkhwaja, A., Alkhwaja, I., Alghamdi, M., Abahussain, H., Albugami, M., Alfawaz, F., El-Ashker, S., & Al-Hariri, M. (2024). Machine Learning Approaches for Predicting Risk of Cardiometabolic Disease among University Students. Big Data and Cognitive Computing, 8(3). https://doi.org/10.3390/bdcc8030031

Natchiar, S. U., & Baulkani, S. (2014). Customer relationship management classification using data mining techniques. In: 2014 International Conference on Science Engineering and Management Research (ICSEMR), Chennai, India, 1–5. https://doi.org/10.1109/ICSEMR.2014.7043662

Nti, I., Quarcoo, J., Fosu, G., & Aning, J. (2022). A Mini-Review of Machine Learning in Big Data Analytics: Applications, Challenges, and Prospects. Big Data Mining and Analytics, 5, 81–97. https://doi.org/10.26599/BDMA.2021.9020028

Painuly, S., Sharma, S., & Matta, P. (2021). Big data driven e-commerce application management system. In: 2021 6th International Conference on Communication and Electronics Systems (ICCES), Coimbatore, India, 1–5. https://doi.org/10.1109/ICCES51350.2021.9489108

Pan, W., Washizaki, H., Yoshioka, N., Fukazawa, Y., Khomh, F., & Guéhéneuc, Y. (2023). A machine learning based approach to detect machine learning design patterns. In: 2023 30th Asia-Pacific Software Engineering Conference (APSEC), Seoul, Korea, Republic of, 574–578. https://doi.org/10.1109/APSEC60848.2023.00073

Petryna, V. V., Doroshenko, A. V., Sydorenko, R. V., & Teslyuk, V. M. (2023). Model and means of data collection and processing using machine learning. Scientific Bulletin of UNFU, 33(3), 102–109. https://doi.org/10.36930/40330315

Raghavan, S. N. R. (2005). Data mining in e-commerce: A survey. Sadhana, 30, 275–289. https://doi.org/10.1007/BF02706248

Rao, T. R., Mitra, P., Bhatt, R., & Goswami, A. (2019). The big data system, components, tools, and technologies: A survey. Knowledge and Information Systems, 60(3), 1165–1245. https://doi.org/10.1007/s10115-018-1248-0

Raschka, S., & Mirjalili, V. (2019). Python machine learning. URL: https://www.w3schools.com/python/python_ml_getting_started.asp

Subach, I., & Mykytiuk, A. (2023). The method pf forming associative rules from the SIEM database – systems based on the theory of fuzzy sets and linguistic terms. Electronic professional scientific publication "Cybersecurity: education, science, technology", 3(19). https://doi.org/10.28925/2663-4023.2023.19.2033

Teslyuk, V., Doroshenko, A., & Savchuk, D. (2023). Intelligent Methods and Models for Assessing Level of Student Adaptation to Online Learning https://www.scopus.com/authid/detail.uri?authorId=57202210835

Turban, E., Whiteside, J., King, D., & Outland, J. (2017). Introduction to electronic commerce and social commerce. Springer Link. https://doi.org/10.1007/978-3-319-50091-1

Uncertainty Based Under-Sampling for Learning Naive Bayes Classifiers Under Imbalanced Data Sets, IEEE Journals & Magazine, IEEE Xplore. (n.d.). (2024). URL: https://ieeexplore.ieee.org/document/8939418

Xu, X., Jia, L., Wang, Z., Zhang, H., Liang, S., & Zhou, C. (2005). Fast algorithm for mining item profit in retails based on microeconomic view. In: 2005 International Conference on Cyberworlds (CW'05), Singapore, 353. https://doi.org/10.1109/CW.2005.44

Опубліковано
2024-05-23
Як цитувати
Петрина, В. В., & Дорошенко, А. В. (2024). Ефективність застосування методів класифікації для задач інтелектуального аналізу великих даних. Scientific Bulletin of UNFU, 34(5), 119-128. https://doi.org/10.36930/40340516
Розділ
Інформаційні технології