Método híbrido de localización visual mediante aprendizaje profundo y características analíticas
Enviado: 30-01-2026
|Aceptado: 30-06-2026
|Publicado: 03-07-2026
Derechos de autor 2026 Marcos Alfaro Pérez, Juan José Cabrera, Oscar Reinoso, Arturo Gil, Luis Payá

Esta obra está bajo una licencia internacional Creative Commons Atribución-NoComercial-CompartirIgual 4.0.
Descargas
Palabras clave:
Robótica móvil, Reconocimiento de lugares, Visión omnidireccional, Fusión sensorial, Aprendizaje profundo
Agencias de apoyo:
Resumen:
La localización precisa es un desafío fundamental para los robots móviles. Si bien el Reconocimiento Visual de Lugares (VPR) basado en modelos de deep learning (DL) ha logrado un rendimiento notable, a menudo presenta problemas de generalización y sensibilidad a cambios de iluminación. Este artículo presenta un método híbrido de VPR mediante imágenes omnidireccionales que combina la capacidad de abstracción del DL con la robustez de las características analíticas de bajo nivel (intensidad, gradiente y hue). Se evalúan estrategias de fusión temprana (early) y tardía (late) para integrar estos canales auxiliares con la información RGB, utilizando modelos preentrenados sin necesidad de reentrenamiento específico. Los experimentos demuestran que la arquitectura de fusión tardía ofrece el mejor rendimiento. Asimismo, se concluye que la incorporación de características analíticas, específicamente la intensidad y el gradiente, incrementa significativamente la robustez del sistema frente a variaciones de iluminación y entornos no vistos durante el entrenamiento, ofreciendo una solución efectiva y económica para la robótica móvil.
Citas:
Alfaro, M., Cabrera, J. J., Reinoso, O., Gil, A., Payá, L., 2025. Localización visual mediante imágenes omnidireccionales y técnicas de fusión temprana. Jornadas de Automática (46). DOI: https://doi.org/10.17979/ja-cea.2025.46.12239
Arandjelovic, R., Gronat, P., Torii, A., Pajdla, T., Sivic, J., 2016. NetVLAD: CNN architecture for weakly supervised place recognition. En: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 5297–5307. DOI: https://doi.org/10.48550/arXiv.1511.07247
Berton, G., Masone, C., Caputo, B., June 2022. Rethinking visual geolocalization for large-scale applications. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 4878–4888. DOI: https://doi.org/10.48550/arXiv.2204.02287
Berton, G., Trivigno, G., Caputo, B., Masone, C., 2023. EigenPlaces: Training viewpoint robust models for visual place recognition. En: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 11080–11090. DOI: https://doi.org/10.48550/arXiv.2308.10832
Cabrera, J. J., Alfaro, M., Gil, A., Reinoso, O., Payá, L., 2026. Robust place recognition under illumination changes using pseudo-LiDAR from omnidirectional images. Scientific Reports 16 (8817). DOI: https://doi.org/10.1038/s41598-026-39848-y
Cabrera, J. J., Santo, A., Gil, A., Viegas, C., Pay´a, L., 2025. MinkUNeXt: point cloud-based large-scale place recognition using 3D sparse convolutions. Array, 100569. DOI: 10.1016/j.array.2025.100569
Chen, C., Wang, B., Lu, C. X., Trigoni, N., Markham, A., 2023. Deep learning for visual localization and mapping: A survey. IEEE Transactions on Neural Networks and Learning Systems 35 (12), 17000–17020. DOI: https://doi.org/10.1109/TNNLS.2023.3309809
Chen, X., Chu, F.-J., Gleize, P., Liang, K. J., Sax, A., Tang, H.,Wang,W., Guo, M., Hardin, T., Li, X., et al., 2025. Sam 3D: 3Dfy anything in images. arXiv preprint arXiv:2511.16624. DOI: https://doi.org/10.48550/arXiv.2511.16624
Di Giammarino, L., Aloise, I., Stachniss, C., Grisetti, G., 2021. Visual Place Recognition using LiDAR intensity information. En: 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). IEEE, pp. 4382–4389. DOI: https://doi.org/10.1109/IROS51168.2021.9636649
Fan, Z., Zhang, L., Wang, X., Shen, Y., Deng, F., 2025. LiDAR, IMU, and camera fusion for simultaneous localization and mapping: a systematic review. Artificial Intelligence Review 58 (6), 1–59. DOI: https://doi.org/10.1007/s10462-025-11187-w
Flores, M., Valiente, D., Peidró, A., Reinoso, O., Payá, L., 2024. Generating a full spherical view by modeling the relation between two fisheye images. The Visual Computer 40 (10), 7107–7132. DOI: 10.1007/s00371-024-03293-7
Gálvez-López, D., Tardos, J. D., 2012. Bags of binary words for fast place recognition in image sequences. IEEE Transactions on robotics 28 (5), 1188–1197. DOI: https://doi.org/10.1109/TRO.2012.2197158
Guarrasi, V., Aksu, F., Caruso, C. M., Di Feola, F., Rofena, A., Ruffini, F., Soda, P., 2025. A systematic review of intermediate fusion in multimodal deep learning for biomedical applications. Image and Vision Computing 158, 105509. DOI: https://doi.org/10.1016/j.imavis.2025.105509
Hausler, S., Jacobson, A., Milford, M., 2019. Multi-process fusion: Visual place recognition using multiple image processing methods. IEEE Robotics and Automation Letters 4 (2), 1924–1931. DOI: https://doi.org/10.1109/LRA.2019.2898427
He, K., Zhang, X., Ren, S., Sun, J., 2016. Deep residual learning for image recognition. En: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 770–778. DOI: https://doi.org/10.48550/arXiv.1512.03385
Hermans, A., Beyer, L., Leibe, B., 2017. In defense of the triplet loss for person re-identification. arXiv preprint arXiv:1703.07737. DOI: https://doi.org/10.48550/arXiv.1703.07737
Huang, H., Liu, C., Zhu, Y., Cheng, H., Braud, T., Yeung, S.-K., June 2024.
360Loc: A dataset and benchmark for omnidirectional visual localization with cross-device queries. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 22314–22324. DOI: 10.48550/arXiv.2311.17389
Izquierdo, S., Civera, J., 2024. Optimal transport aggregation for Visual Place Recognition. En: Proceedings of the ieee/cvf conference on computer vision and pattern recognition. pp. 17658–17668. DOI: https://doi.org/10.48550/arXiv.2311.15937
Keetha, N., Mishra, A., Karhade, J., Jatavallabhula, K. M., Scherer, S., Krishna, M., Garg, S., 2023. AnyLoc: Towards universal visual place recognition. IEEE Robotics and Automation Letters 9 (2), 1286–1293. DOI: https://doi.org/10.1109/LRA.2023.3343602
Lai, H., Yin, P., Scherer, S., 2022. Adafusion: Visual-LiDAR fusion with adaptive weights for place recognition. IEEE Robotics and Automation Letters 7 (4), 12038–12045. DOI: https://doi.org/10.1109/LRA.2022.3210880
Li, Z., Shang, T., Xu, P., Deng, Z., 2025. Place recognition meet multiple modalities: a comprehensive review, current challenges and future development. Artificial Intelligence Review 58 (11), 363. DOI: https://doi.org/10.1007/s10462-025-11367-8
Lin, H., Chen, S., Liew, J., Chen, D. Y., Li, Z., Shi, G., Feng, J., Kang, B., 2025. Depth Anything 3: Recovering the visual space from any views. arXiv preprint arXiv:2511.10647. DOI: https://doi.org/10.48550/arXiv.2511.10647
Liu, Z., Mao, H., Wu, C.-Y., Feichtenhofer, C., Darrell, T., Xie, S., June 2022. A ConvNet for the 2020s. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 11976–11986. DOI: https://doi.org/10.48550/arXiv.2201.03545
Maaten, L. v. d., Hinton, G., 2008. Visualizing data using t-SNE. Journal of machine learning research 9 (Nov), 2579–2605. DOI: 10.5555/3045118.3045270
Máximo, M., Santo, A., Gil, A., Ballesta, M., Valiente, D., 2026. A coarseto-fine 3D LiDAR localization with deep local features for long-term robot navigation in large environments. International Journal of Intelligent Systems 2026 (1), 4278222. DOI: 10.1155/int/4278222
Menegatti, E., Maeda, T., Ishiguro, H., 2004. Image-based memory for robot navigation using properties of omnidirectional images. Robotics and Autonomous Systems 47 (4), 251–267. DOI: https://doi.org/10.1016/j.robot.2004.03.014
Payá, L., Reinoso, O., Berenguer, Y., Úbeda, D., 2016. Using omnidirectional vision to create a model of the environment: A comparative evaluation of global-appearance descriptors. Journal of Sensors 2016 (1), 1209507. DOI: https://doi.org/10.1155/2016/1209507
Pronobis, A., Caputo, B., 2009. COLD: The CoSy localization database. The International Journal of Robotics Research 28 (5), 588–594. DOI: 10.1177/0278364909103912
Rostkowska, M., Skrzypczy´nski, P., 2023. Optimizing appearance-based localization with catadioptric cameras: small-footprint models for real-time inference on edge devices. Sensors 23 (14), 6485. DOI: https://doi.org/10.3390/s23146485
Sarlin, P.-E., DeTone, D., Malisiewicz, T., Rabinovich, A., June 2020. Superglue: Learning feature matching with graph neural networks. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 4938–4947. DOI: https://doi.org/10.48550/arXiv.1911.11763
Siagian, C., Itti, L., 2007. Rapid biologically-inspired scene classification using features shared with visual attention. IEEE transactions on pattern analysis and machine intelligence 29 (2), 300–312. DOI: https://doi.org/10.1109/TPAMI.2007.40
Simonyan, K., Zisserman, A., 2014. Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556. DOI: https://doi.org/10.48550/arXiv.1409.1556
Wang, T.-H., Huang, H.-J., Lin, J.-T., Hu, C.-W., Zeng, K.-H., Sun, M., 2018. Omnidirectional CNN for visual place recognition and navigation. En: 2018 IEEE International Conference on Robotics and Automation (ICRA). IEEE, pp. 2341–2348. DOI: https://doi.org/10.1109/ICRA.2018.8463173
Zhou, Z., Xu, J., Xiong, G., Ma, J., 2023. LCPR: A multi-scale attention-based LiDAR-camera fusion network for place recognition. IEEE Robotics and Automation Letters 9 (2), 1342–1349. DOI: https://doi.org/10.1109/LRA.2023.3346753
Zhu, Q., Yeh, M.-C., Cheng, K.-T., Avidan, S., 2006. Fast human detection using a cascade of histograms of oriented gradients. En: 2006 IEEE computer society conference on computer vision and pattern recognition (CVPR’06). Vol. 2. IEEE, pp. 1491–1498. DOI: https://doi.org/10.1109/CVPR.2006.119




