La tecnología de deepfakes ha facilitado considerablemente que los estafadores suplanten a profesionales de los negocios. Ahora, un estafador puede unirse a una llamada en cámara y responder preguntas en tiempo real de manera convincente haciéndose pasar por otra persona.

Este es el tercer canal de suplantación habilitada por la IA, después del correo electrónico y la voz, y es aquel para el que las empresas están menos preparadas: un rostro en una videollamada se siente completamente humano e imposible de falsificar.

Ya hemos explicado cómo las campañas de suplantación (phishing) con IA son más rápidas y fáciles de lanzar, y cómo la clonación de voz está aumentando los intentos de «vishing». En este artículo, exploraremos qué sucede cuando la identidad de una persona es apropiada mediante videos deepfake y cómo evitar que los miembros del equipo caigan en estafas con deepfakes.

Qué diferencia al fraude con videos deepfake

El engaño por correo electrónico se basa en detalles escritos: el tono adecuado, el contexto correcto y una solicitud que suena razonable pero es urgente. La clonación de voz se basa en el oído: una voz familiar que dice algo lo bastante urgente como para sortear un momento de duda. El fraude con videos deepfake va un paso más allá y compromete el único instinto de verificación que la mayoría de las personas nunca piensa en cuestionar: ver el rostro de alguien y escucharlo hablar, en tiempo real, en una llamada que se ve exactamente igual que cualquier otra videollamada del calendario.

Se enseña a los empleados a desconfiar de un correo electrónico y a verificar dos veces una llamada telefónica inesperada. Casi nadie está entrenado para cuestionar una videollamada cara a cara, porque el video siempre ha sido tan confiable como una reunión presencial.

Esta nueva frontera del fraude exige reevaluar qué merece de confianza en el trabajo, así como la facilidad con la que la urgencia puede anular los procesos.

Cómo funcionan las estafas con deepfakes en la práctica

El fraude con videos deepfake puede adoptar varias formas. La más simple es un video deepfake pregrabado reproducido en una llamada en vivo, a veces con el atacante silenciando su propia cámara y alegando problemas de conectividad para explicar por qué el «ejecutivo» no responde con naturalidad a las preguntas de seguimiento.

Los ataques más sofisticados utilizan herramientas de reemplazo de rostro en tiempo real durante una llamada en vivo real, lo que permite al atacante responder, asentir y reaccionar en el momento, algo mucho más difícil de detectar.

Ha surgido un tercer patrón, que se basa específicamente en las reuniones de incorporación (onboarding) y de cumplimiento. Una identidad sintética en video que se hace pasar por un auditor, un empleado nuevo o un contacto de recursos humanos puede asistir a una reunión completa diseñada para obtener acceso al sistema, respuestas de seguridad o credenciales, precisamente porque esas reuniones se basan en el supuesto de que una videollamada con una persona real es confiable por naturaleza.

Un ejemplo real de fraude con deepfakes

En 2024, un empleado de finanzas de la oficina de Hong Kong de Arup(nueva ventana), una empresa de ingeniería con sede en Reino Unido, se unió a una videollamada con personas que parecían ser el director financiero de la empresa y varios colegas. Cada persona en esa llamada era un deepfake generado por IA, creado a partir de grabaciones disponibles públicamente de ejecutivos reales.

Creyendo que la solicitud era genuina, el empleado autorizó quince transferencias por un total de aproximadamente $25 millones antes de que se descubriera el fraude, y solo entonces porque ocurrió que consultó con la sede central real de la empresa sobre la «transacción confidencial» que acababa de completar.

El caso Arup sigue siendo la ilustración más clara de cómo luce este ataque a gran escala, pero no es un incidente único. El informe de fraude 2026 de UK Finance(nueva ventana) encontró que las pérdidas totales por fraude de pagos alcanzaron 1280 millones de libras en 2025, y señaló específicamente que los grupos criminales organizados utilizan cada vez más deepfakes, voces clonadas e identidades sintéticas para suplantar a personas de confianza y eludir las verificaciones de identidad.

Investigaciones independientes de la industria realizadas por Sumsub(nueva ventana) registraron un aumento interanual del 94 % en los intentos de deepfake en Reino Unido, y una encuesta de Gartner a líderes de seguridad(nueva ventana) encontró que el 62 % de las organizaciones había sufrido algún tipo de ataque con deepfake en los doce meses anteriores. Toda empresa que todavía considere esto un problema del futuro está por detrás de lo que ya muestran los datos.

El incidente de Arup es especialmente ilustrativo en cuanto a lo que hay que tener en cuenta. El instinto inicial del empleado fue correcto: trató el correo electrónico original como un probable intento de suplantación (phishing) y pidió una videollamada específicamente para confirmarlo, que es exactamente el paso de verificación que recomendaría la mayoría de las capacitaciones de seguridad.

El fallo ocurrió en el paso siguiente, cuando la videollamada en sí se consideró prueba suficiente, porque nadie le había advertido que un rostro convincente en pantalla ya no es confiable. En ese momento, el fallo se debió a una capacitación empresarial insuficiente, no al empleado.

¿Cuáles son algunos escenarios posibles de fraude con deepfakes?

Las mecánicas descritas anteriormente se manifiestan en algunos escenarios recurrentes, cada uno dirigido a un punto de apalancamiento distinto dentro de una empresa. Todos comparten el mismo truco de fondo: un rostro y una voz convincentes en una llamada que parece completamente normal, pero el objetivo y el beneficio pueden variar.

El rostro de un director financiero que autoriza una transferencia bancaria

Un deepfake de un ejecutivo de finanzas de alto nivel aparece en una llamada e instruye a un subordinado para que procese un pago urgente y confidencial. La presencia de un rostro familiar y aparentemente en vivo elimina las dudas que un correo electrónico por sí solo habría generado.

Un auditor falso que extrae credenciales del sistema

Una identidad sintética que se hace pasar por un auditor externo o un revisor de cumplimiento realiza una entrevista en video con el personal de TI o de finanzas, presentada como una revisión de rutina, y hace preguntas diseñadas específicamente para revelar detalles de acceso al sistema, respuestas a preguntas de seguridad o información de inicio de sesión.

Un gerente de recursos humanos sintético que incorpora a un nuevo empleado

Un contacto de recursos humanos generado con deepfake organiza una llamada de incorporación con un empleado realmente nuevo, o con un empleado existente bajo el pretexto de una actualización de política, y utiliza la sesión para recopilar detalles sobre los sistemas internos, los permisos de acceso o la información de recuperación de credenciales.

Suplantación de un miembro de la junta directiva ante un oficial financiero

Un deepfake de un miembro de la junta directiva o de un consejero no ejecutivo senior se une a una llamada con un oficial financiero para autorizar una transacción o solicitar información financiera sensible, apoyándose en la autoridad de un rol que un equipo de finanzas está culturalmente entrenado para no cuestionar.

Por qué el fraude con deepfakes es más difícil de detectar

La mayoría de los programas de capacitación contra la suplantación (phishing) y contra el vishing funcionan enseñando a las personas a agregar fricción a un proceso que alguien intenta apresurar: un correo electrónico se puede reenviar a TI para verificarlo dos veces y una llamada telefónica se puede terminar para verificar el número de teléfono.

Las videollamadas no reciben el mismo escrutinio instintivo, porque durante años la videollamada ha sido el sustituto digital más cercano a estar en una habitación con alguien. Rara vez se les dice a los empleados que desconfíen del rostro de un colega, porque el supuesto cultural detrás de las videoconferencias es que son totalmente confiables.

Ese supuesto es exactamente lo que explota el fraude con videos deepfake. El atacante no necesita vencer el escepticismo de un empleado sobre la solicitud en sí. Solo necesita proporcionar lo único que siempre ha eliminado el escepticismo en el pasado: un rostro familiar que responde con naturalidad en tiempo real.

Esa es una barrera mucho más alta para un empleado, y es la razón por la que los protocolos de verificación para este canal deben ser procedimentales y no depender de que alguien simplemente note que algo está mal.

También hay una dinámica social que debe cuestionarse. Cuestionar una solicitud escrita parece una diligencia ordinaria. Cuestionar una llamada telefónica parece razonable, ya que suplantar una voz es un riesgo conocido desde hace años.

Pero cuestionar un rostro en una videollamada, especialmente el de un colega de alto nivel, puede sentirse más cerca de una acusación, que es precisamente por lo que los empleados dudan en hacerlo incluso cuando algo en la interacción les parece un poco extraño. Eliminar ese costo social, hacer que la pregunta sea rutinaria y esperada en lugar de incómoda, es tan parte de la prevención de deepfakes y de la defensa como cualquier control técnico.

Protocolos de verificación que funcionan específicamente para el video

Crear un código

Las palabras en código o los gestos acordados previamente, establecidos de antemano a través de un canal separado, son una de las pocas cosas que un deepfake genuinamente no puede producir, porque no existen en ninguna grabación pública con la que un atacante pueda entrenar un modelo.

Una frase sencilla y cambiable o una señal física, confirmadas periódicamente entre el personal de alto nivel y los equipos de finanzas, les dan a los empleados algo concreto que solicitar en lugar de depender de una sensación subjetiva de que la llamada parece incorrecta.

Establecer reglas de autorización inamovibles

Ninguna autorización financiera ni divulgación de credenciales debería realizarse únicamente a través de una videollamada. Esto debe ser una política concreta, no una decisión dejada al criterio de quien esté en la llamada en ese momento: cualquier solicitud de ese tipo, independientemente de quien parezca hacerla, requiere una segunda confirmación a través de un canal genuinamente separado, utilizando los detalles de contacto que ya constan en el archivo y no ningún dato proporcionado durante la llamada en sí.

Los empleados necesitan permiso explícito y repetido para preguntar «¿eres realmente tú?» en cualquier llamada, independientemente de quien parezca estar en pantalla. También deben sentirse con la comodidad de pedir una prueba a través de otro canal de que la persona es quien dice ser.

El instinto que impide a las personas cuestionar a una figura de alto nivel es precisamente en lo que se basa este ataque, y ese instinto solo desaparece cuando el liderazgo deja claro que la pregunta siempre es aceptable.

Conservar registros

Grabar y registrar las videollamadas confidenciales, especialmente las que involucran autorizaciones financieras, acceso a credenciales o incorporaciones, le brinda a una empresa algo que revisar después del hecho si resulta que una solicitud era fraudulenta, y el saber que una reunión queda registrada es en sí mismo un leve disuasivo contra los atacantes que prefieren operar sin dejar rastro.

Tratar las videollamadas de la misma manera que se trata un correo electrónico

El fraude con videos deepfake tiene éxito porque explota el único canal para el que las empresas nunca han entrenado a sus empleados a cuestionar. El engaño por correo electrónico está cubierto por la concienciación sobre la suplantación (phishing), y el engaño por voz está cubierto por la verificación mediante devolución de llamada y la capacitación que ya hemos escrito sobre la ingeniería social en términos más amplios.

Estar alerta ante las videollamadas con deepfakes no requiere que los empleados se conviertan en analistas forenses capaces de detectar un video sintético fotograma a fotograma. Requiere que una empresa acepte que un rostro y una voz convincentes ya no son prueba de nada por sí solos, y que cree hábitos de verificación que no dependan de que alguien sospeche en el momento.

Reforzar esa cultura junto con las prácticas más amplias que se abordan en nuestra guía sobre cómo crear una cultura sólida de seguridad en el lugar de trabajo le da a un equipo el mismo instinto para el video que una buena capacitación ya desarrolla para el correo electrónico y las llamadas telefónicas.

La conexión de las credenciales: limitar hasta dónde puede llegar una verificación fallida

Sea cual sea la forma que adopte un ataque de deepfake por video (fraude al director financiero, un auditor falso, un contacto de RR. HH. sintético), en última instancia apunta a una de dos cosas: una transacción financiera o un conjunto de credenciales. El video es simplemente el mecanismo de entrega de una solicitud que, si tiene éxito, transfiere dinero directamente o le da al atacante un inicio de sesión que le permite causar daños a voluntad.

Por eso la higiene de las credenciales es importante, incluso cuando el ataque en sí no tiene al principio nada que ver con una contraseña robada. Si una llamada con deepfake logra que alguien entregue una credencial, las contraseñas únicas y la autenticación multifactor limitan hasta dónde puede llegar realmente esa única credencial.

El mismo principio de contención que abordamos en relación con el compromiso del correo electrónico empresarial se aplica aquí: el objetivo no es que cada empleado sea individualmente invencible frente a un ataque sofisticado, sino asegurarse de que, cuando la verificación falla una vez, el daño se mantenga contenido.

Un gestor de contraseñas empresarial como Proton Pass for Business hace que la contención sea realista de mantener: elimina la presión de reutilizar contraseñas familiares en todas las cuentas y facilita que los empleados cumplan las políticas de contraseñas. Si se combina con una plataforma segura para videoconferencias y con una cultura laboral que considera normal, y no sospechoso, pausar para verificar, esa combinación es la que realmente limita el daño cuando ya no se puede confiar plenamente en las videollamadas.

Reduzca la exposición de su equipo al fraude de suplantación de identidad con un gestor de contraseñas empresarial.