La IA puede vincular cuentas anónimas con identidades reales por apenas unos dólares
0
0

Un estudio de investigadores vinculados con ETH Zurich, MATS y Anthropic describe cómo modelos de IA pueden cruzar publicaciones públicas con perfiles reales sin hackeos ni filtraciones. Las pruebas muestran resultados relevantes, aunque sus condiciones controladas no permiten concluir que cualquier cuenta seudónima pueda identificarse con la misma facilidad.
***
- El sistema combina extracción de pistas, búsqueda web, razonamiento y calibración para encontrar posibles identidades detrás de publicaciones seudónimas.
- En una prueba con 338 usuarios de Hacker News, identificó correctamente a 226; el costo estimado por búsqueda fue de USD $1 a USD $4.
- Los resultados no prueban que toda cuenta anónima pueda ser identificada: la escala del grupo de candidatos y las condiciones del experimento limitan el alcance.
La IA ya puede conectar cuentas seudónimas con perfiles reales, según un estudio
Un sistema que combina modelos de lenguaje y búsqueda web logró identificar usuarios detrás de publicaciones anónimas en pruebas controladas, sin recurrir a hackeos ni bases de datos filtradas.
Investigadores de ETH Zurich, el grupo de seguridad de IA MATS y Nicholas Carlini, investigador de Anthropic, analizaron cómo los modelos de lenguaje pueden relacionar comentarios públicos con identidades reales. Su trabajo, titulado “Large-scale online deanonymization with LLMs”, sostiene que los detalles dispersos en publicaciones pueden convertirse en pistas cuando una herramienta los organiza, los compara con información disponible en internet y evalúa las coincidencias.
La conclusión no es que cualquier cuenta anónima pueda descubrirse de manera automática, sino que el costo y la velocidad de ciertas búsquedas han cambiado. Según el reporte de Decrypt sobre el estudio, el proceso puede costar entre USD $1 y USD $4 por objetivo y no exige acceso interno, filtraciones ni intrusiones informáticas, porque se apoya en contenidos públicos y capacidades que ya ofrecen los sistemas de IA.
Cómo funciona el proceso de identificación
Los autores describen cuatro etapas: “Extract”, “Search”, “Reason” y “Calibrate”. Primero, el sistema resume los indicios presentes en las publicaciones de una persona, como lugares donde podría vivir, ocupación, intereses y rasgos particulares que aparecen de forma casual, por ejemplo una variante ortográfica o la mención de una mascota.
En la etapa de búsqueda, esos indicios se convierten en representaciones numéricas, conocidas como embeddings, que permiten comparar rápidamente el resumen con perfiles disponibles en la web. El sistema no necesita que cada usuario publique su nombre: intenta encontrar candidatos cuyos datos y expresiones coincidan con el conjunto de pistas que la cuenta dejó a lo largo del tiempo.
Después, un modelo de mayor capacidad examina las coincidencias más prometedoras y contrasta detalles, en una tarea que los investigadores describen como un proceso de razonamiento similar al de una investigación humana. La última etapa, llamada “Calibrate”, hace que la IA estime su nivel de confianza y evite presentar una respuesta cuando la evidencia no alcanza el umbral previsto por el método.
La combinación importa porque las publicaciones no suelen venir ordenadas en una base de datos limpia. Bromas, comentarios sobre el trabajo, referencias geográficas y preferencias personales pueden parecer irrelevantes por separado, pero al agruparse forman una descripción que sirve para reducir el número de identidades posibles y enfocar la búsqueda.
Qué mostraron las pruebas y qué no
En uno de los experimentos, el equipo reunió 338 usuarios de Hacker News que habían incluido en sus biografías un enlace a su perfil de LinkedIn. Los investigadores retiraron los datos que permitían identificarlos directamente y pidieron a un agente de IA que intentara averiguar sus identidades mediante búsqueda web; el sistema encontró correctamente a 226 personas, equivalentes al 67% de la muestra.
El estudio también indica que el sistema se equivocó en aproximadamente una de cada diez identificaciones que decidió proponer. Esa cifra debe leerse junto con el porcentaje de aciertos: el modelo no necesariamente resolvió todos los casos, y una respuesta correcta entre las opciones que ofrece no equivale a encontrar a cada integrante de la población examinada.
En otra prueba, los investigadores usaron transcripciones de entrevistas realizadas por Anthropic a 125 científicos. La IA identificó correctamente al menos a nueve personas a partir de la manera en que describían su trabajo, un resultado que muestra cómo la información profesional y el estilo de expresión pueden servir como pistas incluso cuando no aparece un nombre en el texto analizado.
El rendimiento también cambia cuando aumenta el universo de candidatos. Frente a un conjunto de 89.000 personas, el método más fuerte capturó alrededor de la mitad de las coincidencias correctas con una precisión del 90%; precisión mide la proporción de respuestas acertadas, mientras que “recall” indica cuántas coincidencias reales logró recuperar el sistema.
Un riesgo real, pero no universal
Las condiciones de la evaluación limitan lo que puede concluirse sobre cuentas desconocidas. Para medir los resultados, los investigadores necesitaban saber de antemano cuál era la identidad de cada sujeto, por lo que eligieron perfiles que ya habían enlazado su cuenta con LinkedIn o dividieron el historial de una misma persona en dos partes y ocultaron la conexión entre ambas.
Por eso, los porcentajes no demuestran que una IA pueda revelar hoy la identidad de cualquier usuario seudónimo elegido al azar. Son pruebas controladas, con sujetos sobre los que existían referencias verificables, y el propio tamaño del conjunto de candidatos afecta la posibilidad de acertar: cuanto mayor es el grupo, más difícil resulta distinguir una coincidencia verdadera entre muchas alternativas.
Los investigadores no publicaron el código, las instrucciones utilizadas ni las identidades reales que descubrieron. El estudio, además, pasó por el comité de revisión ética de ETH Zurich, según el reporte de Decrypt; sus autores presentan el trabajo como documentación de una capacidad, no como la distribución de una herramienta lista para doxear personas.
La preocupación, sin embargo, no depende de que exista un “botón” único para identificar a alguien. El método encadena tareas corrientes, como resumir textos y buscar coincidencias, de modo que bloquear una función específica quizá no baste para impedir que actores distintos reconstruyan una identidad a partir de información pública.
Implicaciones para la privacidad y los usuarios de cripto
El antecedente citado en el debate es el estudio de 2008 que logró cruzar calificaciones supuestamente anónimas de Netflix con reseñas públicas de IMDb. La diferencia que destacan los investigadores es que los modelos actuales pueden trabajar con texto desordenado y no estructurado, en lugar de limitarse a comparar conjuntos de datos organizados, y automatizar parte del análisis que antes requería más tiempo.
Para usuarios de criptomonedas, la amenaza tiene una consecuencia concreta: revelar una identidad puede facilitar que se vinculen cuentas, actividad pública y datos personales. Coinbase informó que ciberdelincuentes sobornaron y reclutaron a agentes externos de soporte para robar datos de clientes y facilitar estafas de ingeniería social. La identificación asistida por IA plantea un camino distinto, porque puede partir de información publicada voluntariamente y no de una brecha.
El riesgo también alcanza a quienes usan seudónimos por razones ajenas al dinero, como activismo, experiencias de abuso, sexualidad, situación migratoria o conflictos con empleadores. Comentarios antiguos sobre una ciudad, un oficio o una mascota pueden adquirir un significado nuevo al combinarse, aunque ningún dato individual pareciera sensible cuando se publicó.
La recomendación que se desprende del estudio no es abandonar internet ni asumir que toda publicación conduce inevitablemente a una identificación. Para reducir la exposición, conviene limitar los detalles específicos que se repiten entre cuentas seudónimas y usar herramientas diseñadas para no conservar datos cuando se comparte información genuinamente sensible; la IA vuelve más rápido y barato un cruce de pistas que ya era posible.
Alcance de la investigación
Los autores plantean que la llamada oscuridad práctica de los usuarios seudónimos ya no puede tratarse como una protección garantizada. La idea no significa que el anonimato haya desaparecido por completo, sino que confiar únicamente en que nadie conectará comentarios dispersos puede ser menos seguro cuando un sistema automatiza la extracción y el cotejo de información pública.
El reporte también sitúa el trabajo en un contexto más amplio de riesgos asociados a la IA. Anthropic informó sobre una campaña de ciberespionaje altamente sofisticada y orquestada con IA que la empresa dijo haber interrumpido. Ese episodio es distinto del método de desanonimización estudiado, pero ilustra la preocupación de que las capacidades de los modelos puedan aprovecharse con fines dañinos antes de que existan salvaguardas suficientes.
En este caso, los investigadores recalcan que no entregaron un kit de doxxing y que el estudio pasó por una revisión ética. Aun así, sus resultados plantean una pregunta práctica para plataformas, desarrolladores y usuarios: cómo proteger la privacidad cuando las mismas herramientas que resumen y buscan información pueden conectar fragmentos que nunca se publicaron juntos.
La respuesta individual más inmediata sigue siendo pensar en la huella acumulada, no solo en una publicación aislada. Un seudónimo puede ocultar el nombre, pero no necesariamente los patrones, referencias y datos que se repiten durante años; por eso, la precaución consiste en decidir qué detalles conviene mantener separados y cuáles no deberían vincularse con una identidad pública.
0
0
Securely connect the portfolio you’re using to start.





