Método híbrido de localización visual mediante aprendizaje profundo y características analíticas

Marcos Alfaro Pérez

Spain

Universidad Miguel Hernández de Elche

Juan José Cabrera

https://orcid.org/0000-0002-7141-7802

Spain

Universidad Miguel Hernández de Elche

Oscar Reinoso

https://orcid.org/0000-0002-1065-8944

Spain

Universidad Miguel Hernández de Elche

Arturo Gil

https://orcid.org/0000-0001-7811-8955

Spain

Universidad Miguel Hernández de Elche

Luis Payá

https://orcid.org/0000-0002-3045-4316

Spain

Universidad Miguel Hernández de Elche

|

Aceptado: 30-06-2026

|

Publicado: 03-07-2026

DOI: https://doi.org/10.4995/riai.2026.25521
Datos de financiación

Descargas

Palabras clave:

Robótica móvil, Reconocimiento de lugares, Visión omnidireccional, Fusión sensorial, Aprendizaje profundo

Agencias de apoyo:

Esta investigación no contó con financiación

Resumen:

La localización precisa es un desafío fundamental para los robots móviles. Si bien el Reconocimiento Visual de Lugares (VPR) basado en modelos de deep learning (DL) ha logrado un rendimiento notable, a menudo presenta problemas de generalización y sensibilidad a cambios de iluminación. Este artículo presenta un método híbrido de VPR mediante imágenes omnidireccionales que combina la capacidad de abstracción del DL con la robustez de las características analíticas de bajo nivel (intensidad, gradiente y hue). Se evalúan estrategias de fusión temprana (early) y tardía (late) para integrar estos canales auxiliares con la información RGB, utilizando modelos preentrenados sin necesidad de reentrenamiento específico. Los experimentos demuestran que la arquitectura de fusión tardía ofrece el mejor rendimiento. Asimismo, se concluye que la incorporación de características analíticas, específicamente la intensidad y el gradiente, incrementa significativamente la robustez del sistema frente a variaciones de iluminación y entornos no vistos durante el entrenamiento, ofreciendo una solución efectiva y económica para la robótica móvil.

Ver más Ver menos

Citas:

Alfaro, M., Cabrera, J. J., Reinoso, O., Gil, A., Payá, L., 2025. Localización visual mediante imágenes omnidireccionales y técnicas de fusión temprana. Jornadas de Automática (46). DOI: https://doi.org/10.17979/ja-cea.2025.46.12239

Arandjelovic, R., Gronat, P., Torii, A., Pajdla, T., Sivic, J., 2016. NetVLAD: CNN architecture for weakly supervised place recognition. En: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 5297–5307. DOI: https://doi.org/10.48550/arXiv.1511.07247

Berton, G., Masone, C., Caputo, B., June 2022. Rethinking visual geolocalization for large-scale applications. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 4878–4888. DOI: https://doi.org/10.48550/arXiv.2204.02287

Berton, G., Trivigno, G., Caputo, B., Masone, C., 2023. EigenPlaces: Training viewpoint robust models for visual place recognition. En: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 11080–11090. DOI: https://doi.org/10.48550/arXiv.2308.10832

Cabrera, J. J., Alfaro, M., Gil, A., Reinoso, O., Payá, L., 2026. Robust place recognition under illumination changes using pseudo-LiDAR from omnidirectional images. Scientific Reports 16 (8817). DOI: https://doi.org/10.1038/s41598-026-39848-y

Cabrera, J. J., Santo, A., Gil, A., Viegas, C., Pay´a, L., 2025. MinkUNeXt: point cloud-based large-scale place recognition using 3D sparse convolutions. Array, 100569. DOI: 10.1016/j.array.2025.100569

Chen, C., Wang, B., Lu, C. X., Trigoni, N., Markham, A., 2023. Deep learning for visual localization and mapping: A survey. IEEE Transactions on Neural Networks and Learning Systems 35 (12), 17000–17020. DOI: https://doi.org/10.1109/TNNLS.2023.3309809

Chen, X., Chu, F.-J., Gleize, P., Liang, K. J., Sax, A., Tang, H.,Wang,W., Guo, M., Hardin, T., Li, X., et al., 2025. Sam 3D: 3Dfy anything in images. arXiv preprint arXiv:2511.16624. DOI: https://doi.org/10.48550/arXiv.2511.16624

Di Giammarino, L., Aloise, I., Stachniss, C., Grisetti, G., 2021. Visual Place Recognition using LiDAR intensity information. En: 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). IEEE, pp. 4382–4389. DOI: https://doi.org/10.1109/IROS51168.2021.9636649

Fan, Z., Zhang, L., Wang, X., Shen, Y., Deng, F., 2025. LiDAR, IMU, and camera fusion for simultaneous localization and mapping: a systematic review. Artificial Intelligence Review 58 (6), 1–59. DOI: https://doi.org/10.1007/s10462-025-11187-w

Flores, M., Valiente, D., Peidró, A., Reinoso, O., Payá, L., 2024. Generating a full spherical view by modeling the relation between two fisheye images. The Visual Computer 40 (10), 7107–7132. DOI: 10.1007/s00371-024-03293-7

Gálvez-López, D., Tardos, J. D., 2012. Bags of binary words for fast place recognition in image sequences. IEEE Transactions on robotics 28 (5), 1188–1197. DOI: https://doi.org/10.1109/TRO.2012.2197158

Guarrasi, V., Aksu, F., Caruso, C. M., Di Feola, F., Rofena, A., Ruffini, F., Soda, P., 2025. A systematic review of intermediate fusion in multimodal deep learning for biomedical applications. Image and Vision Computing 158, 105509. DOI: https://doi.org/10.1016/j.imavis.2025.105509

Hausler, S., Jacobson, A., Milford, M., 2019. Multi-process fusion: Visual place recognition using multiple image processing methods. IEEE Robotics and Automation Letters 4 (2), 1924–1931. DOI: https://doi.org/10.1109/LRA.2019.2898427

He, K., Zhang, X., Ren, S., Sun, J., 2016. Deep residual learning for image recognition. En: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 770–778. DOI: https://doi.org/10.48550/arXiv.1512.03385

Hermans, A., Beyer, L., Leibe, B., 2017. In defense of the triplet loss for person re-identification. arXiv preprint arXiv:1703.07737. DOI: https://doi.org/10.48550/arXiv.1703.07737

Huang, H., Liu, C., Zhu, Y., Cheng, H., Braud, T., Yeung, S.-K., June 2024.

360Loc: A dataset and benchmark for omnidirectional visual localization with cross-device queries. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 22314–22324. DOI: 10.48550/arXiv.2311.17389

Izquierdo, S., Civera, J., 2024. Optimal transport aggregation for Visual Place Recognition. En: Proceedings of the ieee/cvf conference on computer vision and pattern recognition. pp. 17658–17668. DOI: https://doi.org/10.48550/arXiv.2311.15937

Keetha, N., Mishra, A., Karhade, J., Jatavallabhula, K. M., Scherer, S., Krishna, M., Garg, S., 2023. AnyLoc: Towards universal visual place recognition. IEEE Robotics and Automation Letters 9 (2), 1286–1293. DOI: https://doi.org/10.1109/LRA.2023.3343602

Lai, H., Yin, P., Scherer, S., 2022. Adafusion: Visual-LiDAR fusion with adaptive weights for place recognition. IEEE Robotics and Automation Letters 7 (4), 12038–12045. DOI: https://doi.org/10.1109/LRA.2022.3210880

Li, Z., Shang, T., Xu, P., Deng, Z., 2025. Place recognition meet multiple modalities: a comprehensive review, current challenges and future development. Artificial Intelligence Review 58 (11), 363. DOI: https://doi.org/10.1007/s10462-025-11367-8

Lin, H., Chen, S., Liew, J., Chen, D. Y., Li, Z., Shi, G., Feng, J., Kang, B., 2025. Depth Anything 3: Recovering the visual space from any views. arXiv preprint arXiv:2511.10647. DOI: https://doi.org/10.48550/arXiv.2511.10647

Liu, Z., Mao, H., Wu, C.-Y., Feichtenhofer, C., Darrell, T., Xie, S., June 2022. A ConvNet for the 2020s. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 11976–11986. DOI: https://doi.org/10.48550/arXiv.2201.03545

Maaten, L. v. d., Hinton, G., 2008. Visualizing data using t-SNE. Journal of machine learning research 9 (Nov), 2579–2605. DOI: 10.5555/3045118.3045270

Máximo, M., Santo, A., Gil, A., Ballesta, M., Valiente, D., 2026. A coarseto-fine 3D LiDAR localization with deep local features for long-term robot navigation in large environments. International Journal of Intelligent Systems 2026 (1), 4278222. DOI: 10.1155/int/4278222

Menegatti, E., Maeda, T., Ishiguro, H., 2004. Image-based memory for robot navigation using properties of omnidirectional images. Robotics and Autonomous Systems 47 (4), 251–267. DOI: https://doi.org/10.1016/j.robot.2004.03.014

Payá, L., Reinoso, O., Berenguer, Y., Úbeda, D., 2016. Using omnidirectional vision to create a model of the environment: A comparative evaluation of global-appearance descriptors. Journal of Sensors 2016 (1), 1209507. DOI: https://doi.org/10.1155/2016/1209507

Pronobis, A., Caputo, B., 2009. COLD: The CoSy localization database. The International Journal of Robotics Research 28 (5), 588–594. DOI: 10.1177/0278364909103912

Rostkowska, M., Skrzypczy´nski, P., 2023. Optimizing appearance-based localization with catadioptric cameras: small-footprint models for real-time inference on edge devices. Sensors 23 (14), 6485. DOI: https://doi.org/10.3390/s23146485

Sarlin, P.-E., DeTone, D., Malisiewicz, T., Rabinovich, A., June 2020. Superglue: Learning feature matching with graph neural networks. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 4938–4947. DOI: https://doi.org/10.48550/arXiv.1911.11763

Siagian, C., Itti, L., 2007. Rapid biologically-inspired scene classification using features shared with visual attention. IEEE transactions on pattern analysis and machine intelligence 29 (2), 300–312. DOI: https://doi.org/10.1109/TPAMI.2007.40

Simonyan, K., Zisserman, A., 2014. Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556. DOI: https://doi.org/10.48550/arXiv.1409.1556

Wang, T.-H., Huang, H.-J., Lin, J.-T., Hu, C.-W., Zeng, K.-H., Sun, M., 2018. Omnidirectional CNN for visual place recognition and navigation. En: 2018 IEEE International Conference on Robotics and Automation (ICRA). IEEE, pp. 2341–2348. DOI: https://doi.org/10.1109/ICRA.2018.8463173

Zhou, Z., Xu, J., Xiong, G., Ma, J., 2023. LCPR: A multi-scale attention-based LiDAR-camera fusion network for place recognition. IEEE Robotics and Automation Letters 9 (2), 1342–1349. DOI: https://doi.org/10.1109/LRA.2023.3346753

Zhu, Q., Yeh, M.-C., Cheng, K.-T., Avidan, S., 2006. Fast human detection using a cascade of histograms of oriented gradients. En: 2006 IEEE computer society conference on computer vision and pattern recognition (CVPR’06). Vol. 2. IEEE, pp. 1491–1498. DOI: https://doi.org/10.1109/CVPR.2006.119

Ver más Ver menos