Сценозалежне ансамблеве виявлення об'єктів на аерознімках безпілотників: межі корисності маршрутизації кадрів за сценами

Ключові слова: зважене злиття рамок, глибоке навчання моделей, згорткові нейронні мережі, еталонний набір даних VisDrone, відкритий набір даних UAVDT, доменний зсув

Анотація

Досліджено сценозалежне ансамблеве виявлення об'єктів на аерознімках безпілотних літальних апаратів (БпЛА), у якому класифікатор сцени (день/ніч/дощ) спрямовує кадр до спеціалізованого пер-сценового ансамблю детекторів зі злиттям передбачень методом зваженого злиття рамок WBF (англ. Weighted Boxes Fusion). Проведено ізолювальний аналіз, який відокремлює внесок сценозалежної маршрутизації даних від внеску самого ансамблювання детекторів; нової архітектури детектора не запропоновано. Виявлено та виправлено систематичні дефекти протоколу оцінювання детекторів – використання порогу впевненості розгортання системи замість оцінювального, невідповідність розмітки 10 і 8 класів та обрізання постоброблення за часом, – які спотворюють оцінки окремих моделей на десятки відсотків і роблять порівняння архітектур детекторів ненадійним. Встановлено, що за коректним протоколом ансамбль детекторів WBF трьох детекторів стабільно перевершує найкращу одиночну модель у кожній сцені (близько +0,05 mAP@50) ціною приблизно триразового зниження швидкості інференсу, тобто йдеться про компроміс Парето. З'ясовано, що сценозалежна маршрутизація кадру не перевершує єдиний сценонезалежний ансамбль детекторів тих самих моделей (різниця −0,0006 mAP@50), і цей результат відтворено на гетерогенному пулі з п'яти поколінь YOLO. Показано, що надлишковість передбачень пулу є властивістю навчального розподілу даних, а не архітектури детектора, у межах перевіреного простору публічних донавчених ваг, доступних станом на липень 2026 року. Встановлено, що на другому наборі даних UAVDT (англ. (Unmanned Aerial Vehicle Benchmark: Detection and Tracking) з офіційними мітками умов (день/ніч/туман) маршрутизація кадру вперше дає статистично значущий виграш за фіксованого обчислювального бюджету ансамблю (+0,014 mAP@50), проте злиття всього пулу моделей без відбору знову поглинає цю перевагу. Сформульовано і підтверджено на двох наборах даних уточнену умову корисності маршрутизації даних: сценоспецифічна перевага має бути невідновлюваною злиттям повного пулу. Показано, що практичною нішею маршрутизації даних є жорсткий обчислювальний бюджет за доменного зсуву з екзогенним джерелом знання про сцену, оскільки класифікатор за виглядом кадру розпізнає критичні несприятливі умови (туман) тільки у 32 % випадків.

Завантаження

Дані завантаження ще не доступні.

Біографії авторів

Х. С. Руда, Національний університет "Львівська політехніка", м. Львів

д-р філософії, доцент, кафедра захисту інформації

В. О. Кромкач, Національний університет "Львівська політехніка", м. Львів

асистент, кафедра захисту інформації

Посилання

Akyon, F. C., Altinuc, S. O., & Temizel, A. (2022). Slicing aided hyper inference and fine-tuning for small object detection. 2022 IEEE International Conference on Image Processing (ICIP), 966–970. https://doi.org/10.1109/ICIP46576.2022.9897990

Bodla, N., Singh, B., Chellappa, R., & Davis, L. S. (2017). Soft-NMS – Improving object detection with one line of code. Proceedings of the IEEE International Conference on Computer Vision (ICCV), 5561–5569. https://doi.org/10.1109/ICCV.2017.593

Cao, Y., He, Z., Wang, L., Wang, W., Yuan, Y., Zhang, D., Zhang, J., Zhu, P., Van Gool, L., Han, J., Hoi, S., Hu, Q., & Liu, M. (2021). VisDrone-DET2021: The vision meets drone object detection challenge results. Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 2847–2854. URL: https://openaccess.thecvf.com/content/ICCV2021W/VisDrone/html/Cao_VisDrone-DET2021_The_Vision_Meets_Drone_Object_Detection_Challenge_Results_ICCVW_2021_paper.html

Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., & Zagoruyko, S. (2020). End-to-end object detection with transformers. Computer Vision – ECCV 2020, 213–229. https://doi.org/10.1007/978-3-030-58452-8_13

Du, D., Qi, Y., Yu, H., Yang, Y., Duan, K., Li, G., Zhang, W., Huang, Q., & Tian, Q. (2018). The unmanned aerial vehicle benchmark: Object detection and tracking. Computer Vision – ECCV 2018, 375–391. https://doi.org/10.48550/arXiv.1804.00518

Han, Y., Huang, G., Song, S., Yang, L., Wang, H., & Wang, Y. (2022). Dynamic neural networks: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(11), 7436–7456. https://doi.org/10.1109/TPAMI.2021.3117837

Jacobs, R. A., Jordan, M. I., Nowlan, S. J., & Hinton, G. E. (1991). Adaptive mixtures of local experts. Neural Computation, 3(1), 79–87. https://doi.org/10.1162/neco.1991.3.1.79

Jocher, G., & Qiu, J. (2024). Ultralytics YOLO11 [Computer software]. GitHub. URL: https://github.com/ultralytics/ultralytics

Jocher, G., Chaurasia, A., & Qiu, J. (2023). Ultralytics YOLOv8 [Computer software]. GitHub. URL: https://github.com/ultralytics/ultralytics

Kennerley, M., Wang, J.-G., Veeravalli, B., & Tan, R. T. (2023). 2PCNet: Two-phase consistency training for day-to-night unsupervised domain adaptive object detection. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11484–11493. https://doi.org/10.48550/arXiv.2303.13853

Lin, T.-Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Dollár, P., & Zitnick, C. L. (2014). Microsoft COCO: Common objects in context. Computer Vision – ECCV 2014, 740–755. https://doi.org/10.1007/978-3-319-10602-1_48

Liu, W., Ren, G., Yu, R., Guo, S., Zhu, J., & Zhang, L. (2022). Image-adaptive YOLO for object detection in adverse weather conditions. Proceedings of the AAAI Conference on Artificial Intelligence, 36(2), pp. 1792–1800. https://doi.org/10.1609/aaai.v36i2.20072

Ouyang-Zhang, J., Cho, J. H., Zhou, X., & Krähenbühl, P. (2022). NMS strikes back. arXiv. https://doi.org/10.48550/arXiv.2212.06137

Redmon, J., Divvala, S., Girshick, R., & Farhadi, A. (2016). You only look once: Unified, real-time object detection. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 779–788. https://doi.org/10.1109/CVPR.2016.91

Saksena, S. K. (2025). VisDrone detection model zoo [Model collection]. Hugging Face. URL: https://huggingface.co/collections/dronefreak/visdrone-detection-model-zoo

Shazeer, N., Mirhoseini, A., Maziarz, K., Davis, A., Le, Q., Hinton, G., & Dean, J. (2017). Outrageously large neural networks: The sparsely-gated mixture-of-experts layer. International Conference on Learning Representations (ICLR), pp. 1–19 https://doi.org/10.48550/arXiv.1701.06538

Solovyev, R., Wang, W., & Gabruseva, T. (2021). Weighted boxes fusion: Ensembling boxes from different object detection models. Image and Vision Computing, 107, article ID 104117. https://doi.org/10.1016/j.imavis.2021.104117

Wang, A., Chen, H., Liu, L., Chen, K., Lin, Z., Han, J., & Ding, G. (2024). YOLOv10: Real-time end-to-end object detection. Advances in Neural Information Processing Systems, 37 (NeurIPS 2024), article ID 93301 https://doi.org/10.48550/arXiv.2405.14458

Wang, C.-Y., Yeh, I-H., & Liao, H.-Y. M. (2024). YOLOv9: Learning what you want to learn using programmable gradient information. Computer Vision – ECCV 2024, 1–21. https://doi.org/10.48550/arXiv.2402.13616

Zhang, H., Liu, K., Gan, Z., & Zhu, G.-N. (2025). UAV-DETR: Efficient end-to-end object detection for unmanned aerial vehicle imagery. arXiv. https://doi.org/10.48550/arXiv.2501.01855

Zhao, Y., Lv, W., Xu, S., Wei, J., Wang, G., Dang, Q., Liu, Y., & Chen, J. (2024). DETRs beat YOLOs on real-time object detection. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 16965–16974. https://doi.org/10.48550/arXiv.2304.08069

Zhu, P., Wen, L., Du, D., Bian, X., Fan, H., Hu, Q., & Ling, H. (2021). Detection and tracking meet drones challenge. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(11), 7380–7399. https://doi.org/10.1109/TPAMI.2021.3119563

Zhu, X., Lyu, S., Wang, X., & Zhao, Q. (2021). TPH-YOLOv5: Improved YOLOv5 based on transformer prediction head for object detection on drone-captured scenarios. Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 2778–2788. https://doi.org/10.48550/arXiv.2108.11539

Опубліковано
2026-09-24
Як цитувати
Руда, Х. С., & Кромкач, В. О. (2026). Сценозалежне ансамблеве виявлення об’єктів на аерознімках безпілотників: межі корисності маршрутизації кадрів за сценами. Scientific Bulletin of UNFU, 36(4), 166–177. https://doi.org/10.36930/40360419
Розділ
Комп’ютерна інженерія