Гібридна архітектура attention U-Net з глибинно-розділюваними згортками для сегментації зображень
Анотація
Розроблено асиметричну архітектуру нейромережі типу U-Net, оптимізовану для функціонування в умовах суворих обмежень на апаратні ресурси оперативної та відеопам'яті обчислювальних систем. Наведено схему вибіркової модифікації структурних компонентів, яка передбачає збереження повнорозмірних стандартних згорткових операцій на етапі стиснення просторових ознак в енкодері для максимального вилучення низькорівневих геометричних особливостей та інтеграцію полегшених глибинно-розділюваних згорткових операцій на етапі відновлення роздільної здатності в шарах декодера. Введено блоки адитивної м'якої уваги для проміжних карт ознак у структурі пропущених зв'язків задля спрямованої стабілізації процесу навчання та повної компенсації можливої втрати точності цифрової сегментації зображень через полегшення внутрішньої архітектури шарів декодера. Проведено серію ідентичних експериментальних запусків процесу навчання моделі з варіативним набором початкових випадкових вагомостей шарів для забезпечення високої статистичної достовірності й об'єктивності порівняльного аналізу. Досліджено поведінку запропонованого гібридного підходу до побудови архітектури нейромережі на спеціалізованому біологічному наборі даних низькоконтрастних об'єктів Kvasir-SEG, що містить одну тисячу цифрових зображень із високою текстурною неоднорідністю навколишнього фону. З'ясовано, що запропонована архітектура нейромережі забезпечує середній показник точності за метрикою Dice на рівні 0,819, демонструючи практичну еквівалентність за якістю сегментації меж зображення порівняно зі стандартним прототипом нейромережі U-Net. При цьому загальну кількість научуваних параметрів нейромережі було успішно зменшено на 14,6 % від базового обсягу. Встановлено трикратне зниження амплітуди коливань валідаційної метрики під час тренування моделі та зменшення стандартного відхилення результатів до 0,004, що чітко вказує на підвищену стійкість сформованої системи до умов початкової ініціалізації вагомостей шарів. Підтверджено ефективність застосування комбінованого функціоналу втрат на основі попіксельної бінарної крос-ентропії та просторового перекриття масок у пропорції 0,3 до 0,7 для надійного пригнічення хибнопозитивних артефактів на тлі текстурних неоднорідностей. Проаналізовано швидкісні характеристики моделі на графічному пришвидшувачі NVIDIA T4 та доведено збереження низької латентності інференсу на рівні 26,41 мс на одне зображення.
Завантаження
Посилання
Ali, O., Ali, H., Shah, S. A. A., & Shahzad, A. (2022). Implementation of a Modified U-Net for Medical Image Segmentation on Edge Devices. IEEE Transactions on Circuits and Systems II, 69(11), 4593–4597. https://doi.org/10.1109/TCSII.2022.3181132
Azad, R., Aghdam, E. K., Rauland, A., Jia, Y., Avval, A. H., Bozorgpour, A., Karimijafarbigloo, S., Cohen, J. P., Adeli, E., & Merhof, D. (2022). Medical Image Segmentation Review: The Success of U-Net. arXiv:2211.14830. https://doi.org/10.48550/arXiv.2211.14830
Conze, P.-H., Andrade-Miranda, G., Singh, V. K., Jaouen, V., & Visvikis, D. (2023). Current and Emerging Trends in Medical Image Segmentation With Deep Learning. IEEE Transactions on Radiation and Plasma Medical Sciences, 7(6), 545–569. https://doi.org/10.1109/TRPMS.2023.3265863
Dice, L. R. (1945). Measures of the amount of ecologic association between species. Ecology, 26(3), 297–302. https://doi.org/10.2307/1932409
Howard, A. G., et al. (2017). MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications. arXiv:1704.04861. https://doi.org/10.48550/arXiv.1704.04861
Jha, D., Smedsrud, P. H., Riegler, M. A., Halvorsen, P., de Lange, T., Johansen, D., & Johansen, H. D. (2020). Kvasir-SEG: A Segmented Polyp Dataset. In International Conference on Multimedia Modeling, (pp. 451–462). Springer. https://doi.org/10.48550/arXiv.1911.07069
Oktay, O., Schlemper, J., Folgoc, L. L., Lee, M., Heinrich, M., Misawa, K., Mori, K., McDonagh, S., Hammerla, N. Y., Kainz, B., Glocker, B., & Rueckert, D. (2018). Attention U-Net: Learning where to look for the pancreas. arXiv:1804.03999. https://doi.org/10.48550/arXiv.1804.03999
Qayoom, A., Xie, J., & Ali, H. (2025). Polyp segmentation in medical imaging: challenges, approaches and future directions. Artificial Intelligence Review, 58, article number 169. https://doi.org/10.1007/s10462-025-11173-2
Ronneberger, O., Fischer, P., & Brox, T. (2015). U-Net: Convolutional Networks for Biomedical Image Segmentation. In Medical Image Computing and Computer-Assisted Intervention – MICCAI 2015 (pp. 234-241). Springer International Publishing. https://doi.org/10.48550/arXiv.1505.04597
Shan, T., Yan, J., Cui, X., & Xie, L. (2023). DSCA-Net: A depthwise separable convolutional neural network with attention mechanism for medical image segmentation. Mathematical Biosciences and Engineering, 20(1), 365–382. https://doi.org/10.3934/mbe.2023017
Sifre, L., & Mallat, S. (2014). Rigid-motion scattering for image classification. Ph.D. thesis. Conference paper. https://doi.org/10.48550/arXiv.1403.1687
Sørensen, T. (1948). A method of establishing groups of equal amplitude in plant sociology based on similarity of species content. Kongelige Danske Videnskabernes Selskab, 5(4), 1–34. URL: https://search.worldcat.org/title/4713331
Wang, C., Wang, S., Shao, S., & Zhai, J. (2024). DeepNeXt: a lightweight polyp segmentation algorithm based on multi-scale attention. Quantitative Imaging in Medicine and Surgery. https://doi.org/10.21037/qims-24-985
Wang, L., Wang, T., Liu, S., et al. (2026). WCEDSAM: A Lightweight Multi-Scale Colonoscopy Polyp-Segmentation Network. Biology, 15(9), article ID 707. https://doi.org/10.3390/biology15090707
Xie, Y., Yang, B., Guan, Q., Zhang, J., Wu, Q., & Xia, Y. (2023). Attention Mechanisms in Medical Image Segmentation: A Survey. arXiv:2305.17937. https://doi.org/10.48550/arXiv.2305.17937
Zhou, W., Ji, J., Jiang, Y., Wang, J., Qi, Q., & Yi, Y. (2023). EARDS: EfficientNet and Attention-based Residual Depth-wise Separable Convolution for Joint OD and OC Segmentation. Frontiers in Neuroscience, 17, article ID 1139181. https://doi.org/10.3389/fnins.2023.1139181
Zhou, Y., Kang, X., Ren, F., Lu, H., Nakagawa, S., & Shan, X. (2023). A Multi-attention and Depthwise Separable Convolution Network for Medical Image Segmentation. Neurocomputing, 564, article ID 126970. https://doi.org/10.1016/j.neucom.2023.126970

Ця робота ліцензується відповідно до Creative Commons Attribution 4.0 International License.



