Сценозалежне ансамблеве виявлення об'єктів на аерознімках безпілотників: межі корисності маршрутизації кадрів за сценами
Анотація
Досліджено сценозалежне ансамблеве виявлення об'єктів на аерознімках безпілотних літальних апаратів (БпЛА), у якому класифікатор сцени (день/ніч/дощ) спрямовує кадр до спеціалізованого пер-сценового ансамблю детекторів зі злиттям передбачень методом зваженого злиття рамок WBF (англ. Weighted Boxes Fusion). Проведено ізолювальний аналіз, який відокремлює внесок сценозалежної маршрутизації даних від внеску самого ансамблювання детекторів; нової архітектури детектора не запропоновано. Виявлено та виправлено систематичні дефекти протоколу оцінювання детекторів – використання порогу впевненості розгортання системи замість оцінювального, невідповідність розмітки 10 і 8 класів та обрізання постоброблення за часом, – які спотворюють оцінки окремих моделей на десятки відсотків і роблять порівняння архітектур детекторів ненадійним. Встановлено, що за коректним протоколом ансамбль детекторів WBF трьох детекторів стабільно перевершує найкращу одиночну модель у кожній сцені (близько +0,05 mAP@50) ціною приблизно триразового зниження швидкості інференсу, тобто йдеться про компроміс Парето. З'ясовано, що сценозалежна маршрутизація кадру не перевершує єдиний сценонезалежний ансамбль детекторів тих самих моделей (різниця −0,0006 mAP@50), і цей результат відтворено на гетерогенному пулі з п'яти поколінь YOLO. Показано, що надлишковість передбачень пулу є властивістю навчального розподілу даних, а не архітектури детектора, у межах перевіреного простору публічних донавчених ваг, доступних станом на липень 2026 року. Встановлено, що на другому наборі даних UAVDT (англ. (Unmanned Aerial Vehicle Benchmark: Detection and Tracking) з офіційними мітками умов (день/ніч/туман) маршрутизація кадру вперше дає статистично значущий виграш за фіксованого обчислювального бюджету ансамблю (+0,014 mAP@50), проте злиття всього пулу моделей без відбору знову поглинає цю перевагу. Сформульовано і підтверджено на двох наборах даних уточнену умову корисності маршрутизації даних: сценоспецифічна перевага має бути невідновлюваною злиттям повного пулу. Показано, що практичною нішею маршрутизації даних є жорсткий обчислювальний бюджет за доменного зсуву з екзогенним джерелом знання про сцену, оскільки класифікатор за виглядом кадру розпізнає критичні несприятливі умови (туман) тільки у 32 % випадків.
Завантаження
Посилання
Akyon, F. C., Altinuc, S. O., & Temizel, A. (2022). Slicing aided hyper inference and fine-tuning for small object detection. 2022 IEEE International Conference on Image Processing (ICIP), 966–970. https://doi.org/10.1109/ICIP46576.2022.9897990
Bodla, N., Singh, B., Chellappa, R., & Davis, L. S. (2017). Soft-NMS – Improving object detection with one line of code. Proceedings of the IEEE International Conference on Computer Vision (ICCV), 5561–5569. https://doi.org/10.1109/ICCV.2017.593
Cao, Y., He, Z., Wang, L., Wang, W., Yuan, Y., Zhang, D., Zhang, J., Zhu, P., Van Gool, L., Han, J., Hoi, S., Hu, Q., & Liu, M. (2021). VisDrone-DET2021: The vision meets drone object detection challenge results. Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 2847–2854. URL: https://openaccess.thecvf.com/content/ICCV2021W/VisDrone/html/Cao_VisDrone-DET2021_The_Vision_Meets_Drone_Object_Detection_Challenge_Results_ICCVW_2021_paper.html
Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., & Zagoruyko, S. (2020). End-to-end object detection with transformers. Computer Vision – ECCV 2020, 213–229. https://doi.org/10.1007/978-3-030-58452-8_13
Du, D., Qi, Y., Yu, H., Yang, Y., Duan, K., Li, G., Zhang, W., Huang, Q., & Tian, Q. (2018). The unmanned aerial vehicle benchmark: Object detection and tracking. Computer Vision – ECCV 2018, 375–391. https://doi.org/10.48550/arXiv.1804.00518
Han, Y., Huang, G., Song, S., Yang, L., Wang, H., & Wang, Y. (2022). Dynamic neural networks: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(11), 7436–7456. https://doi.org/10.1109/TPAMI.2021.3117837
Jacobs, R. A., Jordan, M. I., Nowlan, S. J., & Hinton, G. E. (1991). Adaptive mixtures of local experts. Neural Computation, 3(1), 79–87. https://doi.org/10.1162/neco.1991.3.1.79
Jocher, G., & Qiu, J. (2024). Ultralytics YOLO11 [Computer software]. GitHub. URL: https://github.com/ultralytics/ultralytics
Jocher, G., Chaurasia, A., & Qiu, J. (2023). Ultralytics YOLOv8 [Computer software]. GitHub. URL: https://github.com/ultralytics/ultralytics
Kennerley, M., Wang, J.-G., Veeravalli, B., & Tan, R. T. (2023). 2PCNet: Two-phase consistency training for day-to-night unsupervised domain adaptive object detection. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11484–11493. https://doi.org/10.48550/arXiv.2303.13853
Lin, T.-Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Dollár, P., & Zitnick, C. L. (2014). Microsoft COCO: Common objects in context. Computer Vision – ECCV 2014, 740–755. https://doi.org/10.1007/978-3-319-10602-1_48
Liu, W., Ren, G., Yu, R., Guo, S., Zhu, J., & Zhang, L. (2022). Image-adaptive YOLO for object detection in adverse weather conditions. Proceedings of the AAAI Conference on Artificial Intelligence, 36(2), pp. 1792–1800. https://doi.org/10.1609/aaai.v36i2.20072
Ouyang-Zhang, J., Cho, J. H., Zhou, X., & Krähenbühl, P. (2022). NMS strikes back. arXiv. https://doi.org/10.48550/arXiv.2212.06137
Redmon, J., Divvala, S., Girshick, R., & Farhadi, A. (2016). You only look once: Unified, real-time object detection. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 779–788. https://doi.org/10.1109/CVPR.2016.91
Saksena, S. K. (2025). VisDrone detection model zoo [Model collection]. Hugging Face. URL: https://huggingface.co/collections/dronefreak/visdrone-detection-model-zoo
Shazeer, N., Mirhoseini, A., Maziarz, K., Davis, A., Le, Q., Hinton, G., & Dean, J. (2017). Outrageously large neural networks: The sparsely-gated mixture-of-experts layer. International Conference on Learning Representations (ICLR), pp. 1–19 https://doi.org/10.48550/arXiv.1701.06538
Solovyev, R., Wang, W., & Gabruseva, T. (2021). Weighted boxes fusion: Ensembling boxes from different object detection models. Image and Vision Computing, 107, article ID 104117. https://doi.org/10.1016/j.imavis.2021.104117
Wang, A., Chen, H., Liu, L., Chen, K., Lin, Z., Han, J., & Ding, G. (2024). YOLOv10: Real-time end-to-end object detection. Advances in Neural Information Processing Systems, 37 (NeurIPS 2024), article ID 93301 https://doi.org/10.48550/arXiv.2405.14458
Wang, C.-Y., Yeh, I-H., & Liao, H.-Y. M. (2024). YOLOv9: Learning what you want to learn using programmable gradient information. Computer Vision – ECCV 2024, 1–21. https://doi.org/10.48550/arXiv.2402.13616
Zhang, H., Liu, K., Gan, Z., & Zhu, G.-N. (2025). UAV-DETR: Efficient end-to-end object detection for unmanned aerial vehicle imagery. arXiv. https://doi.org/10.48550/arXiv.2501.01855
Zhao, Y., Lv, W., Xu, S., Wei, J., Wang, G., Dang, Q., Liu, Y., & Chen, J. (2024). DETRs beat YOLOs on real-time object detection. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 16965–16974. https://doi.org/10.48550/arXiv.2304.08069
Zhu, P., Wen, L., Du, D., Bian, X., Fan, H., Hu, Q., & Ling, H. (2021). Detection and tracking meet drones challenge. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(11), 7380–7399. https://doi.org/10.1109/TPAMI.2021.3119563
Zhu, X., Lyu, S., Wang, X., & Zhao, Q. (2021). TPH-YOLOv5: Improved YOLOv5 based on transformer prediction head for object detection on drone-captured scenarios. Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 2778–2788. https://doi.org/10.48550/arXiv.2108.11539

Ця робота ліцензується відповідно до Creative Commons Attribution 4.0 International License.



