IA
Una investigación de McAfee muestra que modelos de inteligencia artificial como Gemma 3 y Qwen 3 VL identifican con hasta 91 % de precisión la ciudad y el país donde se tomó una foto, solo a partir de detalles visuales, incluso si no contiene datos de geolocalización.

Una nueva investigación revela que las herramientas de inteligencia artificial ya pueden determinar con alta precisión el lugar exacto donde se tomó una fotografía publicada en redes sociales, incluso cuando carece por completo de metadatos de ubicación, coordenadas GPS o cualquier información oculta en el archivo. El estudio, realizado por la empresa McAfee, demostró que los modelos de IA lograron identificar correctamente la ciudad y el país de origen en casi nueve de cada diez intentos, basándose únicamente en los elementos visuales contenidos en la imagen.
Para evaluar esta capacidad, los investigadores emplearon más de 21 000 fotografías de viaje. Antes de someterlas al análisis, eliminaron toda información que pudiera revelar directamente la ubicación: metadatos EXIF, etiquetas geográficas, nombres de archivos o anotaciones textuales. Luego probaron dos modelos de código abierto disponibles sin suscripción: Gemma 3 27B, desarrollado por Google, y Qwen 3 VL 30B, creado por Alibaba. Gemma alcanzó una tasa de acierto del 87 % en la identificación simultánea de ciudad y país; Qwen superó ese resultado con un 91 %.
Los modelos no requieren señales externas como GPS, marcas geográficas o nombres de lugares. En su lugar, examinan decenas de indicios visuales presentes en la escena: estructuras arquitectónicas, letreros comerciales, nombres de tiendas, siluetas del horizonte, características de la iluminación natural, señalización vial, diseño urbano de las calles e incluso puestos de comida callejera. Estos elementos se comparan con los patrones almacenados en el modelo sobre distintas regiones del mundo para calcular la ubicación más probable.
La identificación resultó más precisa cuando las fotos incluían monumentos turísticos reconocibles o rasgos visuales distintivos. En cambio, los modelos enfrentaron mayores dificultades ante imágenes de playas genéricas, carreteras rurales o habitaciones de hoteles sin rasgos identificables. Aun así, en numerosos casos, la IA logró determinar correctamente el país de origen incluso cuando no pudo especificar la ciudad con exactitud.
El experimento no se limitó a imágenes públicas. Empleados de McAfee subieron fotos personales de sus propios viajes —algunas nunca compartidas antes— a plataformas de inteligencia artificial como ChatGPT, Claude y Copilot, y solicitaron que identificaran el lugar de captura. En uno de los ejemplos documentados, el sistema reconoció con éxito un paisaje fluvial con árboles y lo ubicó en Hastings-on-Hudson, una localidad de la región neoyorquina.
Según el informe, esta capacidad representa un nuevo vector de amenaza. Los estafadores podrían recopilar fotos de viajes publicadas abiertamente en Instagram, Facebook o X, procesarlas mediante modelos de IA para deducir la ubicación y, posiblemente, inferir el momento de la ausencia del usuario. Con esa información, podrían diseñar mensajes de phishing altamente personalizados: advertencias falsas de bancos sobre transacciones inusuales mientras la víctima está en una ciudad específica, o notificaciones engañosas de intentos de inicio de sesión desde esa misma ubicación. No se exige una localización exacta al 100 %: basta con que el dato sea plausible para generar credibilidad ante la víctima.
El estudio subraya una tendencia creciente: detalles que parecían irrelevantes —como el estilo de una farola, el color de una pared o la forma de un toldo— adquieren valor geográfico preciso cuando son analizados por modelos avanzados. Compartir una imagen de un viaje ya no implica solo mostrar una experiencia a amigos o seguidores; también puede implicar revelar involuntariamente la ubicación física real, aun cuando no se haya etiquetado el sitio ni se haya autorizado la geolocalización del dispositivo. No obstante, los modelos aún presentan limitaciones significativas para identificar direcciones exactas o ubicaciones en tiempo real a partir de una sola imagen genérica sin puntos de referencia claros.



