Дослідження впливу обрізання та тонкого налаштування моделі автоматичного розпізнавання мовлення на її точність

Ключові слова: нейронні мережі, точність моделі, ефективність, зменшення розміру моделі, перенесення навчання

Анотація

Досліджено вплив методів обрізання моделі та тонкого її налаштування на точність автоматичного розпізнавання мовлення ASR (англ. Automatic Speech Recognition) для мови з низьким ресурсом. Використану модель "wav2vec2-xls-r-300 m-uk", попередньо навчено на великому багатомовному наборі даних і тонко налаштовано на українському наборі даних із Common Voice. Метод обрізання за L1-нормою було застосовано на різних рівнях (10, 20, 30, 40, 50 %%) без подальшого налаштування, що виявило значне зниження точності (метрика WER (англ. Word Error Rate) збільшилася з 18,53 до 35,96 %%, метрика CER (англ. Character Error Rate) – з 3,5 до 7,97 %%). Встановлено, що зі збільшенням ступеня обрізання точність моделей поступово знижується, однак подальше тонке налаштування значно покращує продуктивність (метрика WER знизилася до 22,81 %, метрика CER – до 4,55 %). Оцінено вплив кількості епох тонкого налаштування на точність моделі, що показало поступове покращення продуктивності зі збільшенням епох (найкращі результати за 20 епох: метрики WER 22,81 %, CER 4,55 %). З'ясовано, що тонке налаштування здатне частково відновити втрату точності, спричинену обрізанням. Наукова новизна дослідження полягає в комплексному аналізі методів обрізання та тонкого налаштування для низькоресурсних мов на прикладі української мови. Виявлено, що комбіноване використання методів обрізання, перенесення навчання та тонкого налаштування є перспективним для підвищення продуктивності та точності ASR моделей. З'ясовано, що методи обрізання дають можливість зменшити розмір моделі та підвищити її ефективність, що є критичним для пристроїв з обмеженими ресурсами. Охарактеризовано закономірності між ступенем обрізання та ефективністю моделі, що вказують на можливість досягнення балансу між продуктивністю та точністю. З'ясовано, що ефективність моделей для мов з низьким ресурсом значно залежить від кількості та якості навчальних даних, а також від методів їх оброблення. Перспективи подальших досліджень містять аналіз різних методів обрізання, розроблення нових підходів до тонкого налаштування та перенесення навчання з використанням додаткових лінгвістичних ознак. Це сприятиме створенню більш ефективних систем розпізнавання мовлення для мов із низьким ресурсом, що дасть змогу подолати технологічний розрив і покращити доступність мовних технологій у глобальному масштабі.

Завантаження

Дані завантаження ще не доступні.

Біографії авторів

Т. Я. Ухачевич, Національний університет "Львівська політехніка", м. Львів

магістр, аспірант, кафедра автоматизованих систем управління

Н. О. Кустра, Національний університет "Львівська політехніка", м. Львів

канд. техн. наук, доцент, кафедра інформаційних технологій видавничої справи

Посилання

Ahia, O., Kreutzer, J., & Hooker, S. (2021). The Low-Resource Double Bind: An Empirical Study of pruning for Low-Resource Machine Translation. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.2110.03036

Ahmad, S., & Hawkins, J. (2016). How do neurons operate on sparse distributed representations? A mathematical theory of sparsity, neurons and active dendrites. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.1601.00720

Ahmad, S., & Scheinkman, L. (2019). How can we be so dense? The benefits of using highly sparse representations. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.1903.11257

Babu, A., Wang, C., Tjandra, A., Lakhotia, K., Xu, Q., Goyal, N., Singh, K., Patrick, V. P., Saraf, Y., Pino, J., Baevski, A., Conneau, A., & Auli, M. (2021). XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.2111.09296

Baevski, A., Zhou, H., Mohamed, A., & Auli, M. (2020). wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.2006.11477

Gordon, M. A., Duh, K., & Andrews, N. (2020). Compressing BERT: Studying the Effects of weight pruning on Transfer Learning. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.2002.08307

Han, S., Pool, J., Tran, J., & Dally, W. J. (2015). Learning both Weights and Connections for Efficient Neural Networks. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.1506.02626

Kimanuka, U., Maina, C. wa, & Büyük, O. (2024). Speech recognition datasets for low-resource Congolese languages. Data in Brief, 52. https://doi.org/10.1016/j.dib.2023.109796

Le, D. H., & Hua, B. (2021). Network pruning that matters: A case study on retraining variants. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.2105.03193

Liang, T., Glossner, J., Wang, L., Shi, S., & Zhang, X. (2021 b). Pruning and Quantization for Deep Neural Network Acceleration: A survey. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.2101.09671

Mirela. (2024). Low-resource languages: A localization challenge. POEditor Blog. URL: https://poeditor.com/blog/low-resource-languages/

Rista, A., & Kadriu, A. (2020). Automatic Speech Recognition: A Comprehensive Survey. SEEU Review, 15(2), 86–112. https://doi.org/10.2478/seeur-2020-0019

Vadera, S., & Ameen, S. (2022). Methods for Pruning Deep Neural Networks. Access, 10, 63280–63300. https://doi.org/10.1109/access.2022.3182659

Wang, D., & Thomas Fang Zheng. (2015). Transfer Learning for Speech and Language Processing. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.1511.06066

Yang, M., Tjandra, A., Liu, C., Zhang, D., Le, D., Hansen, J. H. L., & Kalinli, O. (2022). Learning ASR pathways: A sparse multilingual ASR model. ArXiv (Cornell University). https://doi.org/10.48550/arxiv.2209.05735

Yu, C., Chen, Y., Li, Y., Kang, M., Xu, S., & Liu, X. (2019). Cross-Language End-to-End Speech Recognition Research based on transfer Learning for the Low-Resource Tujia Language. Symmetry, 11(2), 179. https://doi.org/10.3390/sym11020179

Опубліковано
2024-05-23
Як цитувати
Ухачевич, Т. Я., & Кустра, Н. О. (2024). Дослідження впливу обрізання та тонкого налаштування моделі автоматичного розпізнавання мовлення на її точність. Scientific Bulletin of UNFU, 34(5), 104-109. https://doi.org/10.36930/40340514
Розділ
Інформаційні технології