La cara y la voz en la pantalla parecen completamente auténticas
Una videollamada entra, y en la pantalla está tu jefe o familiar, hablando con urgencia sobre una situación crítica, pidiendo que transfieras dinero de inmediato, e incluso interactuando normalmente, respondiendo a algunas preguntas casuales. Esta situación se ha vuelto frecuente en casos de fraude recientes, y la tecnología detrás de todo esto es el deepfake en tiempo real, que combina el cambio de cara y voz en tiempo real para simular una videollamada que parece completamente auténtica.
¿Qué tan lejos puede llegar la tecnología deepfake en tiempo real?
El principio central de la tecnología deepfake es recopilar una gran cantidad de imágenes faciales y muestras de voz del objetivo, luego entrenar un sistema capaz de convertir en tiempo real los movimientos de la cara y la voz del atacante en el aspecto y la voz del objetivo. En años recientes, la capacidad de cómputo de esta tecnología ha mejorado significativamente, permitiendo que las imágenes producidas se sincronicen con el ritmo de interacción en tiempo real de la videollamada, a diferencia de las viejas técnicas que solo se podían usar en videos pregrabados. Sin embargo, el deepfake en tiempo real sigue teniendo limitaciones tecnológicas, especialmente en condiciones de señal de red inestable, condiciones de iluminación complejas, o cuando se le pide a la persona que realice movimientos inesperados, lo que puede facilitar la aparición de defectos visuales. Esto indica que, aunque la tecnología tiene cierta capacidad de engaño, no es infalible, y comprender estas limitaciones es un punto importante para evaluar su veracidad.
Métodos de verificación que se pueden intentar en el momento de la llamada
1. Pide a la persona que realice un movimiento no preparado, como girar la cabeza repentinamente para mostrar el lado de su cara, o mover la mano rápidamente frente a su rostro. La tecnología deepfake tiende a mostrar distorsiones en la imagen, desalineación facial o retrasos en la sincronización en este tipo de movimientos inesperados. 2. Pregunta un detalle específico que solo tú conocerías, no tiene que ser información confidencial; puede ser algo trivial que solo ustedes compartan, como qué comieron la última vez que se vieron o el estado de un amigo en común. La tecnología deepfake puede replicar apariencia y voz, pero no puede saber detalles que solo existen en la memoria real. 3. Corta la llamada y utiliza otro canal independiente para volver a contactar a la persona, como llamar directamente al número que conoces. No devuelvas la llamada al número que aparece en la llamada anterior; si la persona real contesta y no tiene idea de que tuvo una videollamada previa, podrás confirmar que la llamada fue un engaño.
Si sospechas que tú o un familiar han caído en esta forma de fraude de videollamada deepfake, o si ya se ha realizado una transferencia, es importante guardar capturas de pantalla de la llamada y los registros de transferencia, y reportar la situación lo antes posible al banco y a la policía. VexelOps también puede ayudar a aclarar la situación.
Preguntas frecuentes sobre los fraudes por videollamada deepfake
¿Por qué los estafadores pueden obtener suficiente material facial y de voz para entrenar este sistema?
En la mayoría de los casos de víctimas, el material obtenido por los atacantes proviene a menudo de contenidos que el objetivo ha hecho público en plataformas sociales, como publicaciones en videos, grabaciones de transmisiones en vivo, conferencias o entrevistas públicas. Este tipo de contenido abierto, si se acumula suficiente duración y variedad de ángulos, puede ser utilizado para entrenar modelos deepfake. Por eso, en años recientes, ha habido recomendaciones de seguridad advirtiendo que figuras públicas o ejecutivos de alto nivel deben considerar el riesgo de abuso de este tipo de materiales al publicar gran cantidad de contenido audiovisual claro y de múltiples ángulos en plataformas sociales, no se trata de desincentivar el compartir, sino de evaluar el alcance y la frecuencia de las publicaciones.
¿Se puede aplicar deepfake a llamadas de voz además de videollamadas?
Sí, y generalmente el deepfake de voz es más fácil de implementar técnicamente que el cambio de cara en videollamadas, porque las muestras de voz son más fáciles de adquirir, y los recursos de computación necesarios para el entrenamiento son menores. Muchos casos recientes de fraude se han realizado mediante llamadas de voz puras, haciéndose pasar por familiares o jefes que necesitan ayuda urgente, con voces que suenan casi idénticas a las reales. La misma lógica de verificación mencionada anteriormente se aplica aquí; colgar la llamada y volver a confirmar a través del método de contacto que conoces es la manera más confiable de responder, sin necesidad de distinguir entre videollamadas o llamadas de voz pura, la misma lógica de verificación se aplica a ambos casos.
¿Qué mecanismo de respuesta debería establecerse dentro de la empresa para reducir el riesgo de que los empleados sean engañados?
A nivel empresarial, se podría considerar establecer un proceso claro de verificación para movimientos de fondos, especialmente para solicitudes que implican transferencias urgentes o grandes gastos, estableciendo que, independientemente del canal de comunicación por el que llegue la instrucción, ya sea videollamada, teléfono o mensajería instantánea, se debe confirmar a través de otro canal independiente acordado previamente antes de llevar a cabo la operación. Al mismo tiempo, se debe realizar capacitación regular para empleados sobre casos de fraude deepfake, para que el equipo comprenda la existencia y el funcionamiento de esta tecnología, lo que puede ser más efectivo para reducir el riesgo general que confiar únicamente en la alerta personal.
Una clave a tener en cuenta: La tecnología de deepfake en tiempo real puede replicar la apariencia y la voz, pero no puede hacer frente a acciones inesperadas y repentinamente, ni conoce los detalles que existen solo en recuerdos reales. Al enfrentar solicitudes de transferencia de emergencia, colgar y reconfirmar a través de canales familiares es la forma más confiable de identificar este tipo de fraude.