WhatsApp ha comenzado a probar Scam Alert, una nueva función de seguridad que utiliza inteligencia artificial para identificar ciberestafas a través de mensajes potencialmente fraudulentos enviados por personas que no forman parte de los contactos del usuario. La principal particularidad del sistema es que todo el análisis se realiza directamente en el dispositivo, evitando que el contenido de las conversaciones tenga que enviarse a los servidores de Meta.
La función se encuentra actualmente en una beta limitada y busca reforzar la protección frente a las numerosas estafas que utilizan WhatsApp como canal para contactar con sus víctimas. Meta ha acompañado las primeras pruebas con una explicación técnica sobre la arquitectura utilizada para mantener el cifrado de extremo a extremo y limitar la información que recibe la compañía.
Además, ha ampliado el alcance de su programa de recompensas por vulnerabilidades para que investigadores externos puedan analizar la seguridad del sistema antes de que Scam Alert llegue a un número mayor de usuarios.
Una IA que funciona dentro del teléfono
Cuando el usuario activa Scam Alert, WhatsApp descarga en el dispositivo un modelo ligero de aprendizaje automático.
Este modelo analiza los mensajes recibidos desde números que no están guardados entre los contactos y busca estructuras conversacionales y patrones lingüísticos relacionados habitualmente con intentos de estafa.
El sistema puede detectar determinadas señales presentes en los mensajes fraudulentos y clasificarlos sin necesidad de enviar el texto a servidores externos.
Esta arquitectura resulta especialmente importante en WhatsApp debido al cifrado de extremo a extremo. Meta asegura que ni el contenido analizado ni los datos utilizados durante la clasificación abandonan el dispositivo.
Tampoco se informa automáticamente a WhatsApp, Meta o terceros sobre el contenido detectado, salvo que sea el propio usuario quien decida realizar alguna acción que implique comunicarlo, como reportar una conversación.
Qué ocurre cuando WhatsApp detecta una posible ciberestafa
Si el modelo considera que un mensaje presenta características sospechosas, WhatsApp muestra una advertencia dentro de la propia conversación.
A partir de ese momento, el usuario puede decidir qué hacer: bloquear al remitente, reportar el chat, continuar con la conversación o marcarla como confiable.
Esta última opción impide que Scam Alert vuelva a mostrar advertencias para ese chat concreto.
El sistema está especialmente orientado hacia mensajes procedentes de personas desconocidas, un escenario habitual en campañas de fraude que comienzan con comunicaciones inesperadas sobre falsas ofertas de empleo, inversiones, premios, problemas con cuentas o intentos de suplantación.
Meta quiere medir su eficacia sin leer los mensajes
Uno de los principales desafíos de Scam Alert consiste en comprobar si el sistema funciona correctamente sin recopilar las conversaciones utilizadas para tomar las decisiones.
Para ello, Meta utiliza diferentes mecanismos de telemetría con preservación de la privacidad.
La compañía puede obtener estadísticas agregadas sobre el número de advertencias generadas o las decisiones posteriores de los usuarios, pero aplica técnicas como privacidad diferencial y umbrales de k-anonimato para evitar que esos datos puedan asociarse directamente con una persona concreta.
El procesamiento también utiliza entornos de ejecución confiables, conocidos como Trusted Execution Environments (TEE), diseñados para aislar la información durante determinadas operaciones.
Las métricas individuales son descartadas después de incorporarse a los datos estadísticos agregados.
Cómo evita WhatsApp que alguien manipule la IA
Otro problema de seguridad aparece en la distribución de los propios modelos de inteligencia artificial.
Un atacante con acceso a esta infraestructura podría intentar proporcionar una versión modificada del modelo únicamente a una víctima determinada. Esto podría permitir, por ejemplo, alterar su funcionamiento sin afectar al resto de usuarios y dificultar la detección de la manipulación.
Para reducir este riesgo, Meta asegura que cada versión del modelo queda identificada mediante su hash SHA-256 y se publica en un registro público de transparencia antes de desplegarse.
El proceso utiliza además una firma proporcionada por un tercero, Cloudflare.
Las solicitudes para descargar los modelos pasan por relés Oblivious HTTP (OHTTP) y utilizan credenciales anónimas. El objetivo es impedir que el servidor pueda conocer qué usuario concreto está solicitando una determinada versión.
Incluso la asignación de usuarios a grupos experimentales para probar nuevos modelos se realiza localmente mediante valores aleatorios generados en el dispositivo.
Los usuarios podrán comprobar qué ha hecho Scam Alert
WhatsApp también pretende ofrecer cierta capacidad de auditoría sobre el funcionamiento de esta protección.
Los participantes podrán consultar su actividad desde Cuenta > Solicitar información > Actividad de Scam Alert, donde aparecerán los mensajes analizados, el resultado de las clasificaciones y la versión del modelo utilizada.
Este registro puede ayudar a comprobar cuándo ha intervenido el sistema y qué decisiones ha tomado la inteligencia artificial.































