viernes, 14 agosto, 2026
10.2 C
Buenos Aires
InicioSociedadAnonimización total: el desafío de proteger los datos personales en la IA

Anonimización total: el desafío de proteger los datos personales en la IA

Un equipo de investigadores argentinos presentó en la RAIE 2026 un marco basado en modelos de lenguaje de gran escala para anonimizar datos sensibles con una tasa de detección del 99%, frente al 56-65% de las herramientas tradicionales.

José tiene 42 años, trabaja en una empresa de logística y hace dos años dejó de ir al banco. Resuelve sus operaciones desde el teléfono: consulta saldo, hace transferencias y paga servicios. Cada interacción genera datos que el banco utiliza para comprender mejor a sus clientes. Desde que interactúa con el asistente de inteligencia artificial del banco, quedan registradas sus palabras, dudas y detalles al explicar un problema.

La información compartida con el asistente no desaparece al finalizar la conversación. Se incorpora a los procesos de entrenamiento y mejora de los modelos de inteligencia artificial del banco. Entrenar modelos con datos reales implica riesgos: un modelo puede retener información sensible de manera no intencional y exponerla de formas difíciles de prever. Además, esa información no debería circular libremente ni procesarse fuera del banco, ya que podría incumplir regulaciones como el Reglamento General de Protección de Datos (GDPR) en Europa o sus equivalentes en América Latina.

La solución más extendida consiste en eliminar o enmascarar la información sensible antes del entrenamiento. Sin embargo, presenta dos limitaciones: la cobertura (las herramientas tradicionales detectan entre el 56% y el 65% de los datos sensibles) y la calidad (al eliminar nombres, fechas y otros elementos, el texto pierde contexto).

Existe otra alternativa: reemplazar los datos reales por información ficticia pero coherente. Por ejemplo, José se convierte en Carlos, sus dos cuentas bancarias pasan a ser tres, su domicilio en Palermo aparece en Belgrano. El modelo aprende con la misma eficacia, pero la identidad original no forma parte del entrenamiento. Ese es el principio de la anonimización total.

Esta idea constituye el núcleo del trabajo desarrollado por un equipo de investigadores argentinos, presentado este año en la RAIE 2026, workshop de Ingeniería de Software Responsable realizado en el marco de la International Conference on Software Engineering. La innovación consiste en utilizar modelos de lenguaje de gran escala (LLMs) para proteger datos. A diferencia de las soluciones tradicionales basadas en patrones predefinidos, un LLM comprende el contexto y genera reemplazos ficticios consistentes con la información original. El proceso ocurre dentro de la infraestructura de la organización: ningún dato abandona el banco ni intervienen servicios externos.

Los resultados informados indican una tasa de detección y reemplazo del 99% de los datos sensibles, frente al 56-65% de las herramientas convencionales. Además, los modelos entrenados sobre datos previamente anonimizados mantienen un 95% de precisión.

Pablo Ronco es Chief Technology Officer de Veritran y coautor del paper «Anonymous-by-Construction: An LLM-Driven Framework for Privacy-Preserving Text», presentado en la RAIE 2026.

Más noticias
Noticias Relacionadas