Гібридна архітектура attention U-Net з глибинно-розділюваними згортками для сегментації зображень

  • Є. Ю. Столярчук Національний технічний університет України "Київський політехнічний інститут імені Ігоря Сікорського", м. Київ https://orcid.org/0009-0009-8008-9423
  • Є. С. Сулема Національний технічний університет України "Київський політехнічний інститут імені Ігоря Сікорського", м. Київ https://orcid.org/0000-0001-7871-9806
Ключові слова: комп'ютерний зір, штучні нейронні мережі, моделі енкодер-декодер, локалізація меж об'єктів, селективне зважування ознак, медичний набір даних Kvasir-SEG, коефіцієнт Дайса-Соренсена, пристрої з обмеженими ресурсами

Анотація

Розроблено асиметричну архітектуру нейромережі типу U-Net, оптимізовану для функціонування в умовах суворих обмежень на апаратні ресурси оперативної та відеопам'яті обчислювальних систем. Наведено схему вибіркової модифікації структурних компонентів, яка передбачає збереження повнорозмірних стандартних згорткових операцій на етапі стиснення просторових ознак в енкодері для максимального вилучення низькорівневих геометричних особливостей та інтеграцію полегшених глибинно-розділюваних згорткових операцій на етапі відновлення роздільної здатності в шарах декодера. Введено блоки адитивної м'якої уваги для проміжних карт ознак у структурі пропущених зв'язків задля спрямованої стабілізації процесу навчання та повної компенсації можливої втрати точності цифрової сегментації зображень через полегшення внутрішньої архітектури шарів декодера. Проведено серію ідентичних експериментальних запусків процесу навчання моделі з варіативним набором початкових випадкових вагомостей шарів для забезпечення високої статистичної достовірності й об'єктивності порівняльного аналізу. Досліджено поведінку запропонованого гібридного підходу до побудови архітектури нейромережі на спеціалізованому біологічному наборі даних низькоконтрастних об'єктів Kvasir-SEG, що містить одну тисячу цифрових зображень із високою текстурною неоднорідністю навколишнього фону. З'ясовано, що запропонована архітектура нейромережі забезпечує середній показник точності за метрикою Dice на рівні 0,819, демонструючи практичну еквівалентність за якістю сегментації меж зображення порівняно зі стандартним прототипом нейромережі U-Net. При цьому загальну кількість научуваних параметрів нейромережі було успішно зменшено на 14,6 % від базового обсягу. Встановлено трикратне зниження амплітуди коливань валідаційної метрики під час тренування моделі та зменшення стандартного відхилення результатів до 0,004, що чітко вказує на підвищену стійкість сформованої системи до умов початкової ініціалізації вагомостей шарів. Підтверджено ефективність застосування комбінованого функціоналу втрат на основі попіксельної бінарної крос-ентропії та просторового перекриття масок у пропорції 0,3 до 0,7 для надійного пригнічення хибнопозитивних артефактів на тлі текстурних неоднорідностей. Проаналізовано швидкісні характеристики моделі на графічному пришвидшувачі NVIDIA T4 та доведено збереження низької латентності інференсу на рівні 26,41 мс на одне зображення.

Завантаження

Дані завантаження ще не доступні.

Біографії авторів

Є. Ю. Столярчук, Національний технічний університет України "Київський політехнічний інститут імені Ігоря Сікорського", м. Київ

аспірант, кафедра програмного забезпечення комп'ютерних систем

Є. С. Сулема, Національний технічний університет України "Київський політехнічний інститут імені Ігоря Сікорського", м. Київ

д-р техн. наук, професор, завідувач кафедри програмного забезпечення комп'ютерних систем

Посилання

Ali, O., Ali, H., Shah, S. A. A., & Shahzad, A. (2022). Implementation of a Modified U-Net for Medical Image Segmentation on Edge Devices. IEEE Transactions on Circuits and Systems II, 69(11), 4593–4597. https://doi.org/10.1109/TCSII.2022.3181132

Azad, R., Aghdam, E. K., Rauland, A., Jia, Y., Avval, A. H., Bozorgpour, A., Karimijafarbigloo, S., Cohen, J. P., Adeli, E., & Merhof, D. (2022). Medical Image Segmentation Review: The Success of U-Net. arXiv:2211.14830. https://doi.org/10.48550/arXiv.2211.14830

Conze, P.-H., Andrade-Miranda, G., Singh, V. K., Jaouen, V., & Visvikis, D. (2023). Current and Emerging Trends in Medical Image Segmentation With Deep Learning. IEEE Transactions on Radiation and Plasma Medical Sciences, 7(6), 545–569. https://doi.org/10.1109/TRPMS.2023.3265863

Dice, L. R. (1945). Measures of the amount of ecologic association between species. Ecology, 26(3), 297–302. https://doi.org/10.2307/1932409

Howard, A. G., et al. (2017). MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications. arXiv:1704.04861. https://doi.org/10.48550/arXiv.1704.04861

Jha, D., Smedsrud, P. H., Riegler, M. A., Halvorsen, P., de Lange, T., Johansen, D., & Johansen, H. D. (2020). Kvasir-SEG: A Segmented Polyp Dataset. In International Conference on Multimedia Modeling, (pp. 451–462). Springer. https://doi.org/10.48550/arXiv.1911.07069

Oktay, O., Schlemper, J., Folgoc, L. L., Lee, M., Heinrich, M., Misawa, K., Mori, K., McDonagh, S., Hammerla, N. Y., Kainz, B., Glocker, B., & Rueckert, D. (2018). Attention U-Net: Learning where to look for the pancreas. arXiv:1804.03999. https://doi.org/10.48550/arXiv.1804.03999

Qayoom, A., Xie, J., & Ali, H. (2025). Polyp segmentation in medical imaging: challenges, approaches and future directions. Artificial Intelligence Review, 58, article number 169. https://doi.org/10.1007/s10462-025-11173-2

Ronneberger, O., Fischer, P., & Brox, T. (2015). U-Net: Convolutional Networks for Biomedical Image Segmentation. In Medical Image Computing and Computer-Assisted Intervention – MICCAI 2015 (pp. 234-241). Springer International Publishing. https://doi.org/10.48550/arXiv.1505.04597

Shan, T., Yan, J., Cui, X., & Xie, L. (2023). DSCA-Net: A depthwise separable convolutional neural network with attention mechanism for medical image segmentation. Mathematical Biosciences and Engineering, 20(1), 365–382. https://doi.org/10.3934/mbe.2023017

Sifre, L., & Mallat, S. (2014). Rigid-motion scattering for image classification. Ph.D. thesis. Conference paper. https://doi.org/10.48550/arXiv.1403.1687

Sørensen, T. (1948). A method of establishing groups of equal amplitude in plant sociology based on similarity of species content. Kongelige Danske Videnskabernes Selskab, 5(4), 1–34. URL: https://search.worldcat.org/title/4713331

Wang, C., Wang, S., Shao, S., & Zhai, J. (2024). DeepNeXt: a lightweight polyp segmentation algorithm based on multi-scale attention. Quantitative Imaging in Medicine and Surgery. https://doi.org/10.21037/qims-24-985

Wang, L., Wang, T., Liu, S., et al. (2026). WCEDSAM: A Lightweight Multi-Scale Colonoscopy Polyp-Segmentation Network. Biology, 15(9), article ID 707. https://doi.org/10.3390/biology15090707

Xie, Y., Yang, B., Guan, Q., Zhang, J., Wu, Q., & Xia, Y. (2023). Attention Mechanisms in Medical Image Segmentation: A Survey. arXiv:2305.17937. https://doi.org/10.48550/arXiv.2305.17937

Zhou, W., Ji, J., Jiang, Y., Wang, J., Qi, Q., & Yi, Y. (2023). EARDS: EfficientNet and Attention-based Residual Depth-wise Separable Convolution for Joint OD and OC Segmentation. Frontiers in Neuroscience, 17, article ID 1139181. https://doi.org/10.3389/fnins.2023.1139181

Zhou, Y., Kang, X., Ren, F., Lu, H., Nakagawa, S., & Shan, X. (2023). A Multi-attention and Depthwise Separable Convolution Network for Medical Image Segmentation. Neurocomputing, 564, article ID 126970. https://doi.org/10.1016/j.neucom.2023.126970

Опубліковано
2026-09-24
Як цитувати
Столярчук, Є. Ю., & Сулема, Є. С. (2026). Гібридна архітектура attention U-Net з глибинно-розділюваними згортками для сегментації зображень. Scientific Bulletin of UNFU, 36(4), 44–50. https://doi.org/10.36930/40360405
Розділ
Інженерія програмного забезпечення