La tecnología deepfake ha hecho mucho más fácil que los estafadores se hagan pasar por profesionales de empresas. Ahora, un estafador puede unirse a una llamada en cámara y responder a las preguntas en tiempo real de forma convincente haciéndose pasar por otra persona.
Se trata del tercer canal de suplantación de identidad mediante IA, después del correo electrónico y la voz, y es aquel para el que las empresas están menos preparadas: una cara en una videollamada parece completamente humana e imposible de falsificar.
Ya hemos explicado cómo las campañas de suplantación de identidad con IA son más rápidas y fáciles de lanzar, y cómo la clonación de voz está aumentando los intentos de vishing. En este artículo, exploraremos qué ocurre cuando la identidad de una persona se ve cooptada mediante vídeos deepfake y cómo evitar que los miembros del equipo caigan en estafas de este tipo.
En qué se diferencia el fraude con vídeos deepfake
El engaño por correo electrónico se basa en detalles escritos: el tono adecuado, el contexto correcto y una petición que suena razonable pero urgente. La clonación de voz se basa en el oído: una voz familiar que dice algo lo bastante urgente como para saltarse un momento de duda. El fraude con vídeos deepfake va un paso más allá y compromete el único instinto de verificación que la mayoría de las personas nunca cuestiona: ver la cara de alguien y escuchar su voz, en tiempo real, en una llamada que parece exactamente igual que cualquier otra videollamada del calendario.
Se entrena a los empleados para desconfiar de un correo electrónico y verificar dos veces una llamada telefónica inesperada. Casi nadie aprende a cuestionar una videollamada cara a cara, porque el vídeo siempre ha sido tan fiable como una reunión presencial.
Esta nueva frontera del fraude exige reevaluar qué se puede considerar de confianza en el trabajo, así como la facilidad con la que la urgencia puede hacer saltarse los procesos.
Cómo funcionan las estafas con deepfakes en la práctica
El fraude con vídeos deepfake puede adoptar varias formas. La más sencilla consiste en reproducir un vídeo deepfake pregrabado en una llamada en directo, en la que el atacante silencia su propia cámara y alega problemas de conectividad para explicar por qué el «directivo» no responde con naturalidad a las preguntas de seguimiento.
Los ataques más sofisticados utilizan herramientas de intercambio de rostros en tiempo real durante una llamada real en directo, lo que permite al atacante responder, asentir y reaccionar en el momento, algo mucho más difícil de detectar.
Ha surgido un tercer patrón, que se basa específicamente en las reuniones de incorporación y de cumplimiento. Una persona sintética generada por vídeo que se hace pasar por un auditor, un empleado nuevo o un contacto de recursos humanos puede permanecer durante toda una reunión diseñada para obtener acceso al sistema, respuestas de seguridad o credenciales, precisamente porque esas reuniones se basan en la suposición de que una videollamada con una persona real es fiable de por sí.
Un ejemplo real de fraude con deepfakes
En 2024, un empleado de finanzas de la oficina de Hong Kong de Arup(ventana nueva), una empresa de ingeniería con sede en el Reino Unido, se unió a una videollamada con personas que parecían ser el director financiero de la empresa y varios colegas. Cada persona en esa llamada era un deepfake generado por IA, creado a partir de material audiovisual disponible públicamente de ejecutivos reales.
Creyendo que la solicitud era auténtica, el empleado autorizó quince transferencias por un total de unos 25 millones de dólares antes de que se descubriera el fraude, y solo entonces porque casualmente se puso en contacto con la oficina central real de la empresa para preguntar por la «transacción confidencial» que acababa de realizar.
El caso de Arup sigue siendo la ilustración más clara de cómo es este ataque a gran escala, pero no se trata de un incidente aislado. El informe de fraude 2026 de UK Finance(ventana nueva) reveló que las pérdidas totales por fraude en pagos alcanzaron 1280 millones de libras en 2025, y destacó específicamente que los grupos criminales organizados utilizan cada vez más deepfakes, voces clonadas e identidades sintéticas para suplantar a personas de confianza y eludir las verificaciones de identidad.
Investigaciones independientes del sector, como las de Sumsub(ventana nueva), registraron un aumento interanual del 94 % en los intentos de fraude con deepfakes en el Reino Unido, y una encuesta de Gartner a responsables de seguridad(ventana nueva) reveló que el 62 % de las organizaciones había sufrido alguna forma de ataque con deepfakes en los doce meses anteriores. Cualquier empresa que todavía considere esto un problema del futuro va por detrás de lo que ya muestran los datos.
El incidente de Arup resulta especialmente ilustrativo de lo que hay que vigilar. El primer instinto del empleado fue acertado: trató el correo electrónico original como un probable intento de suplantación de identidad y pidió una videollamada precisamente para confirmarlo, que es exactamente el paso de verificación que recomendaría la mayoría de las formaciones de seguridad.
El fallo se produjo en el siguiente paso, cuando la videollamada en sí se consideró prueba suficiente, porque nadie le había dicho que una cara convincente en pantalla ya no es fiable. En ese momento, el fallo se debió a una formación empresarial insuficiente, no al empleado.
¿Cuáles son algunos escenarios posibles de fraude con deepfakes?
Los mecanismos descritos anteriormente se manifiestan en una serie de escenarios recurrentes, cada uno dirigido a un punto de presión diferente dentro de una empresa. Todos comparten el mismo truco subyacente: una cara y una voz convincentes en una llamada que parece completamente normal, pero el objetivo y la recompensa pueden variar.
La cara de un director financiero que autoriza una transferencia bancaria
Un deepfake de un alto ejecutivo de finanzas aparece en una llamada e indica a un subordinado que procese un pago urgente y confidencial. La presencia de una cara familiar, aparentemente en directo, disipa las dudas que un simple correo electrónico habría despertado.
Un auditor falso que extrae credenciales del sistema
Una persona sintética que se hace pasar por un auditor externo o un revisor de cumplimiento realiza una entrevista por vídeo con el personal de TI o de finanzas, presentada como una revisión de rutina, y hace preguntas diseñadas específicamente para obtener detalles sobre el acceso al sistema, respuestas a preguntas de seguridad o información de inicio de sesión.
Un responsable de recursos humanos sintético que incorpora a un empleado nuevo
Un contacto falso de recursos humanos, generado con deepfake, organiza una llamada de incorporación con un empleado realmente nuevo, o con uno existente bajo la apariencia de una actualización de la política, y aprovecha la sesión para recopilar detalles sobre los sistemas internos, los permisos de acceso o la información de recuperación de credenciales.
Suplantación de un miembro del consejo ante un responsable financiero
Un deepfake de un miembro del consejo o de un alto directivo no ejecutivo se une a una llamada con un responsable financiero para autorizar una transacción o solicitar información financiera confidencial, apoyándose en la autoridad de un rol que un equipo de finanzas está culturalmente formado para no cuestionar.
Por qué el fraude con deepfakes es más difícil de detectar
La mayoría de los programas de formación contra la suplantación de identidad (phishing) y el vishing funcionan enseñando a las personas a añadir fricción a un proceso que alguien intenta apresurar: un correo electrónico se puede reenviar a TI para verificarlo dos veces, y una llamada telefónica se puede colgar para verificar el número.
Las videollamadas no reciben el mismo escrutinio instintivo, porque durante años la videollamada ha sido el sustituto digital más cercano a estar en una sala con alguien. Rara vez se pide a los empleados que desconfíen de la cara de un colega, porque la suposición cultural detrás de las videoconferencias es que son totalmente fiables.
Esta suposición es la que explota el fraude con vídeos deepfake. Un atacante no necesita vencer el escepticismo de un empleado sobre la solicitud en sí. Solo tiene que aportar lo único que siempre ha bastado para disipar el escepticismo en el pasado: una cara familiar que responde con naturalidad en tiempo real.
Se trata de una barrera mucho más alta para un empleado, y por eso los protocolos de verificación para este canal deben ser procedimentales y no depender de que alguien simplemente note que algo va mal.
También hay que cuestionar una dinámica social. Cuestionar una solicitud escrita parece una diligencia ordinaria. Cuestionar una llamada telefónica parece razonable, ya que suplantar una voz es un riesgo conocido desde hace años.
Pero cuestionar la cara de alguien en una videollamada, en particular la de un colega de rango superior, puede parecerse más a una acusación, y precisamente por eso los empleados dudan en hacerlo incluso cuando algo de la interacción resulta ligeramente extraño. Eliminar ese costo social, convertir la pregunta en algo rutinario y esperado en lugar de incómodo, es tan parte de la prevención de deepfakes y de la defensa como cualquier control técnico.
Protocolos de verificación que funcionan específicamente para vídeo
Crear un código
Las palabras en código o los gestos acordados de antemano a través de un canal separado son una de las pocas cosas que un deepfake realmente no puede producir, porque no existen en ningún material audiovisual público con el que un atacante pudiera entrenar un modelo.
Una frase sencilla y cambiable, o una señal física, confirmada periódicamente entre el personal directivo y los equipos de finanzas, les da a los empleados algo concreto que pedir, en lugar de depender de una sensación subjetiva de que la llamada parece sospechosa.
Fijar las reglas de autorización de forma inamovible
Ninguna autorización financiera ni divulgación de credenciales debe realizarse nunca por videollamada únicamente. Esto debe ser una política concreta, no una decisión dejada al criterio de quien esté en la llamada en ese momento: cualquier solicitud de ese tipo, independientemente de quién parezca hacerla, requiere una segunda confirmación a través de un canal genuinamente independiente, utilizando datos de contacto que ya consten en el archivo y no ningún dato suministrado durante la propia llamada.
Los empleados necesitan permiso explícito y repetido para preguntar «¿eres tú de verdad?» en cualquier llamada, independientemente de quién parezca estar en pantalla. También deben sentirse con la libertad de pedir una prueba por otro canal de que la persona es quien dice ser.
El instinto que impide a las personas cuestionar a una figura de autoridad es precisamente en lo que se basa este ataque, y ese instinto solo desaparece cuando el liderazgo deja claro de forma inequívoca que la pregunta siempre es aceptable.
Guardar registros
Grabar y registrar videollamadas sensibles, en particular cualquier asunto relacionado con autorizaciones financieras, acceso a credenciales o incorporaciones, le da a una empresa algo que revisar después si resulta que una solicitud era fraudulenta, y saber que una reunión queda registrada es en sí mismo un elemento disuasorio leve contra los atacantes que prefieren actuar sin dejar rastro.
Tratar las videollamadas igual que un correo electrónico
El fraude con vídeos deepfake tiene éxito porque explota el único canal que las empresas nunca han enseñado a los empleados a cuestionar. El engaño por correo electrónico está cubierto por la concienciación sobre la suplantación de identidad, y el engaño por voz está cubierto por la verificación mediante devolución de llamada y la formación de la que hemos escrito sobre la ingeniería social en términos más generales.
Ser consciente de las videollamadas deepfake no requiere que los empleados se conviertan en analistas forenses capaces de detectar un vídeo sintético fotograma a fotograma. Requiere que una empresa acepte que una cara y una voz convincentes ya no son prueba de nada por sí solas, y que establezca hábitos de verificación que no dependan de que alguien se vuelva sospechoso en el momento.
Reforzar esa cultura junto con las prácticas más amplias tratadas en nuestra guía sobre cómo construir una cultura de seguridad sólida en el trabajo le da al equipo el mismo instinto para el vídeo que una buena formación ya construye para el correo electrónico y las llamadas telefónicas.
La conexión entre credenciales: limitar el alcance de una verificación fallida
Sea cual sea la forma que adopte un ataque de video deepfake (fraude al director financiero, un auditor falso, un contacto sintético de recursos humanos), en última instancia apunta a una de dos cosas: una transacción financiera o un conjunto de credenciales. El video es simplemente el mecanismo de entrega de una petición que, si tiene éxito, mueve dinero directamente o da al atacante un inicio de sesión que le permite causar daños a su antojo.
Por eso es importante la higiene de las credenciales, incluso cuando el ataque en sí no tiene al principio nada que ver con una contraseña robada. Si una llamada deepfake consigue que alguien entregue una credencial, las contraseñas únicas y la autenticación multifactor limitan lo que esa única credencial puede alcanzar realmente.
El mismo principio de contención que hemos abordado en relación con el compromiso del correo electrónico empresarial se aplica aquí: el objetivo no es que cada empleado sea invencible por sí solo ante un ataque sofisticado, sino asegurarse de que, cuando la verificación falla una vez, el daño se mantenga contenido.
Un gestor de contraseñas empresarial como Proton Pass for Business hace que mantener la contención sea algo realista: elimina la presión de reutilizar contraseñas conocidas en varias cuentas y facilita que los empleados cumplan las políticas de contraseñas. Junto con una plataforma segura para videoconferencias y una cultura laboral que considera pausar para verificar algo normal en lugar de sospechoso, esa combinación es la que realmente limita el daño cuando ya no se puede confiar plenamente en las videollamadas.
Reduce la exposición de tu equipo al fraude por suplantación con un gestor de contraseñas empresarial.






