¿Qué son los deepfakes? ¿Cómo funcionan los vídeos y los medios generados por IA?
-
Añádenos como fuente preferida
- 01 ¿Qué es un deepfake? Cómo funcionan los vídeos y los medios generados por IA.
- 02 ¿Cómo funciona realmente un deepfake?
- 03 Breve historia de la tecnología deepfake.
- 04 ¿Cómo funciona la IA deepfake: GANs y modelos de difusión?
- 05 Los diferentes tipos de deepfakes
- 06 Deepfakes vs. Cheapfakes: ¿Por qué es importante la distinción?
- 07 La evolución de la tecnología deepfake
- 08 ¿Cuáles son los riesgos de los deepfakes?
- 09 ¿Cómo se utilizan los deepfakes en las estafas en línea?
- 10 ¿Qué sectores se ven más afectados por los deepfakes?
- 11 ¿Cuáles son las señales más comunes de un deepfake?
- 12 ¿Llegará el deepfake a ser imposible de distinguir del contenido real?
- 13 ¿Cómo ayuda Shufti a las empresas a mantenerse a la vanguardia?
TL; DR
- Un deepfake es un vídeo, imagen o audio sintético generado por inteligencia artificial, producido por un modelo de aprendizaje automático entrenado con material de archivo real, no editado a partir de material de archivo real como una imagen retocada con Photoshop.
- La tecnología deepfake se remonta a 2014 (GANs) y recibió su nombre en 2017; ahora es lo suficientemente barata y rápida como para ejecutarse en tiempo real en aplicaciones de consumo.
- Los deepfakes se diferencian de los "cheapfakes" (ediciones simples, sin IA) y plantean riesgos graves: fraude de identidad, pérdidas financieras y desinformación, especialmente en los servicios financieros, las tecnologías financieras y los seguros.
- Entre los signos más comunes se incluyen el parpadeo antinatural, la falta de sincronización labial, un tono de audio robótico y peticiones urgentes o inusuales.
- La detección de deepfakes a gran escala requiere defensas por capas, como comprobaciones de autenticidad y detección de deepfakes, no una revisión manual.
¿Qué es un deepfake? Cómo funcionan los vídeos y los medios generados por IA.
Un deepfake es un contenido multimedia sintético, generalmente un vídeo, una imagen o un audio, generado o alterado por inteligencia artificial para hacer que una persona real parezca decir o hacer algo que nunca hizo. El término combina "aprendizaje profundo" con "falsificación", y la IA de deepfake ha avanzado tan rápidamente que ahora se puede crear una falsificación convincente a partir de una pequeña muestra de material auténtico o unos pocos segundos de voz grabada.
¿Cómo funciona realmente un deepfake?
A nivel técnico, un deepfake es el resultado de un modelo de aprendizaje automático entrenado con ejemplos reales de una persona, fotos, fotogramas de vídeo o grabaciones de audio, hasta que aprende los patrones que hacen reconocible a esa persona: la geometría de su rostro, la forma en que se mueve, el tono y el ritmo de su voz. Una vez entrenado, el modelo puede generar nuevo material a demanda, colocando a la persona en una escena, una frase o un clip de audio en el que nunca apareció realmente. El resultado no se edita a partir de material real como se recorta o retoca una foto; se genera desde cero por el modelo, la misma calidad explotada en Ataques de inyección y presentación deepfakey por qué un deepfake bien hecho puede resistir un escrutinio que una edición manual no podría.
Vídeo, imagen y audio deepfake
Los deepfakes se presentan en tres formas principales:
- Vídeo deepfake: se inserta el rostro o el cuerpo de una persona real en una grabación, o se manipulan sus expresiones para que coincidan con un guion que nunca interpretó.
- Imágenes deepfake: una fotografía fija de un rostro, un documento o una escena se fabrica o altera para que parezca real.
- Audio deepfake: se clona una voz a partir de una muestra corta y se la hace decir cualquier texto; es una técnica muy utilizada en estafas telefónicas y de ingeniería social.
Breve historia de la tecnología deepfake.
La tecnología detrás de los deepfakes no surgió de la noche a la mañana. La técnica principal, la red generativa antagónica (GNA), fue introducida en 2014 por el investigador de aprendizaje automático Ian Goodfellow, entonces estudiante de doctorado, como una forma de enfrentar dos redes neuronales hasta que una produjera imágenes falsas convincentes. El término "deepfake" en sí mismo no se popularizó hasta diciembre de 2017, cuando un usuario anónimo de Reddit, que publicaba bajo ese nombre, comenzó a compartir videos manipulados con IA, lo que le dio a la técnica tanto su nombre como su notoriedad inicial. En pocos años, la investigación que antes requería un laboratorio especializado se había convertido en aplicaciones para el consumidor, transformando un ejercicio académico de nicho en una tecnología disponible para cualquiera con un teléfono inteligente.
¿Cómo funciona la IA deepfake: GANs y modelos de difusión?
La IA deepfake se basa principalmente en dos familias de modelos:
- Redes Generativas Antagónicas (GAN): dos redes neuronales compiten. Un generador crea señales falsas mientras que un discriminador intenta detectarlas. A medida que compiten, el generador mejora hasta que su resultado puede engañar tanto al discriminador como, a menudo, a un observador humano.
- Modelos de difusión: la tecnología que sustenta muchos de los generadores de imágenes y vídeos más realistas de la actualidad. Aprenden a invertir un proceso de adición de ruido, de modo que pueden partir de ruido aleatorio y refinarlo gradualmente hasta obtener un resultado fotorrealista.
Ambos enfoques han reducido las barreras de entrada. Lo que antes requería grandes conjuntos de datos y conocimientos técnicos ahora se puede hacer con aplicaciones para el consumidor, a veces en tiempo real durante una videollamada en directo.
Este cambio se ha acelerado por Deepfake de IA generativa herramientas que pueden producir vídeo y audio sintéticos en segundos.
Los diferentes tipos de deepfakes
- Intercambio de rostros: en un vídeo, el rostro de una persona se superpone a la cabeza de otra.
- Recreación facial: se conserva el rostro de la persona objetivo, pero sus expresiones y movimientos de cabeza son dirigidos por un actor o un guion.
- Deepfakes de sincronización labial: se altera un metraje existente para que la boca coincida con el nuevo audio.
- Clonación de voz: una copia sintética de una voz real, creada a partir de tan solo unos segundos de habla.
- Síntesis de cuerpo completo y de texto a vídeo: personas y escenas enteras generadas desde cero, cada vez más a partir de una simple indicación de texto.
Deepfakes vs. Cheapfakes: ¿Por qué es importante la distinción?
No todos los vídeos manipulados son deepfakes. Los investigadores utilizan el término «falsificación barata», a veces llamado «shallowfake», para referirse a contenido multimedia alterado mediante métodos sencillos y de bajo coste, en lugar de aprendizaje automático: cortar fragmentos de vídeo fuera de contexto, ralentizar o acelerar un clip, etiquetar erróneamente un vídeo auténtico o usar software de edición básico para cambiar una cara. Las falsificaciones baratas no requieren IA, lo que las hace mucho más fáciles de producir y, en la práctica, igual de capaces de engañar al público. La distinción es importante para la verificación: una falsificación barata suele detectarse comprobando la fuente o el contexto original, mientras que un deepfake auténtico requiere el tipo de análisis técnico que se describe en esta guía. Tratar cada vídeo sospechoso como un posible deepfake conlleva el riesgo de pasar por alto el truco más sencillo y común que hay detrás.
La evolución de la tecnología deepfake
Los primeros deepfakes requerían horas de procesamiento y aún presentaban fallos. Desde entonces, la tecnología ha evolucionado en tres aspectos: los modelos necesitan mucho menos material de origen, la generación es lo suficientemente rápida como para ejecutarse en tiempo real y las herramientas prefabricadas se han extendido ampliamente. Una amenaza que antes se limitaba a actores con grandes recursos ahora está al alcance de casi cualquiera, razón por la cual el fraude con deepfakes ha pasado de ser una novedad a un riesgo empresarial generalizado.
Este cambio es visible en el aumento de deepfake como servicio ofertas que permiten a cualquiera alquilar capacidades de deepfake bajo demanda.
¿Cuáles son los riesgos de los deepfakes?
Los riesgos de los deepfakes van mucho más allá de un solo vídeo falso. Abarcan daños financieros, a la reputación y a la sociedad.
Fraude de identidad y suplantación de identidad
- Se utilizan rostros sintéticos y voces clonadas para suplantar la identidad de los clientes, eludir la incorporación remota y derrotar a los clientes. controles de verificación de edady abrir cuentas con identidades robadas o inventadas.
Daño financiero y reputacional
- Más allá del robo directo, las empresas se enfrentan a contracargos, costos de remediación y sanciones regulatorias en un contexto en constante evolución. leyes sobre deepfakesy perdió la confianza de los clientes, que había costado años construir.
Desinformación y manipulación
- Los vídeos manipulados de figuras públicas pueden difundir declaraciones falsas, e incluso las grabaciones auténticas pueden ser descartadas como falsas, un efecto que erosiona progresivamente la confianza pública.
¿Cómo se utilizan los deepfakes en las estafas en línea?
Los deepfakes se utilizan en estafas para suplantar la identidad de alguien en quien la víctima ya confía, lo que hace que baje la guardia. Las tácticas comunes incluyen:
- Fraude de directores ejecutivos y altos cargos: Una voz o vídeo clonado de un alto directivo autorizando un pago urgente.
- Suplantación de identidad de familiares y amigos: Voces clonadas en llamadas de auxilio exigiendo dinero.
- Estafas románticas y de inversión: Perfiles sintéticos creados para ganarse la confianza con el tiempo.
- Patrocinios falsos: Imágenes manipuladas digitalmente de celebridades o funcionarios que promocionan criptomonedas y esquemas de comercio.
- Omisión de la verificación: Se utilizan selfies y vídeos falsos para burlar los controles de identidad remotos.
La magnitud del problema es real. En 2024, un empleado del departamento financiero de la empresa de ingeniería Arup fue engañado para que transfiriera alrededor de 25 millones de dólares estadounidenses tras unirse a una videollamada en la que aparecían recreaciones digitales de sus compañeros de trabajo.
Detén las identidades sintéticas antes de que lleguen a tus sistemas.
Las verificaciones manuales no pueden seguir el ritmo de las falsificaciones modernas. Shufti verifica a las personas en más de 240 países y territorios, utilizando análisis de presencia y ataques de presentación basados en IA para detectar deepfakes durante el proceso de incorporación, en tiempo real.
¿Qué sectores se ven más afectados por los deepfakes?
Cualquier sector que dependa de la confianza en la identidad o la imagen de una persona está expuesto, pero algunos son atacados con mayor intensidad que otros:
- Servicios financieros y bancarios: Apertura de cuentas, autorización de pagos y transferencias de alto valor.
- Tecnología financiera y criptomonedas: Incorporación rápida y remota, y transacciones irreversibles.
- Seguro: Reclamaciones fraudulentas respaldadas por imágenes y vídeos manipulados.
- GGobierno y servicios públicos: Fraude en prestaciones sociales y uso indebido de identidad.
- Medios de comunicación y entretenimiento: Ataques a la reputación y declaraciones falsas.
- Telecomunicaciones: Estafas de intercambio de SIM y de robo de cuentas.
- Economía colaborativa y de trabajos temporales: Identidades falsas de conductor, anfitrión y trabajador.
Remoto KYC y las verificaciones de incorporación son el denominador común en todos los sectores de esta lista.
¿Cuáles son las señales más comunes de un deepfake?
Aunque las mejores falsificaciones son difíciles de detectar a simple vista, muchos deepfakes aún dejan pistas. Conocer las señales comunes ayuda a las personas y a los equipos a mantenerse alerta.
Señales visuales en vídeo e imágenes
- Parpadeo antinatural o ojos que no siguen ni reflejan la luz de forma consistente.
- Desenfoque o distorsión en la zona donde el rostro se une al cabello, las orejas, las gafas o el escote.
- Piel que se ve demasiado lisa, cerosa o que no coincide con la iluminación.
- Movimientos labiales ligeramente descoordinados o dientes planos y poco definidos.
- Bordes parpadeantes y sombras que cambian de forma extraña entre fotogramas.
Señales sonoras
- Una cadencia monótona o robótica con pausas o énfasis inusuales.
- Ruido de fondo que aparece y desaparece de forma poco natural.
- Sonidos respiratorios y bucales ausentes o mal ubicados.
Señales contextuales
- Urgencia, secretismo o presión para actuar con rapidez.
- Solicitudes inusuales, especialmente aquellas que implican dinero o credenciales.
- Un canal o comportamiento que no coincide con la forma en que la persona se comunica normalmente.
Estas comprobaciones manuales ayudan a las personas, pero no son escalables. Una empresa que verifica a miles de personas no puede revisar visualmente cada selfie o video en busca de distorsiones y parpadeos. Las organizaciones que necesitan detectar contenido sintético de forma automática y a gran escala dependen de sistemas diseñados específicamente para ello. detección de vida y la detección de deepfakes como parte de su proceso de verificación de identidad.
¿Llegará el deepfake a ser imposible de distinguir del contenido real?
Los deepfakes ya son lo suficientemente convincentes como para engañar al ojo humano, y su calidad seguirá mejorando a medida que su generación sea más económica y rápida. Sin embargo, es improbable que lleguen a ser completamente indistinguibles. Los estándares de procedencia, como las credenciales de contenido, las marcas de agua digitales y la verificación por capas, avanzan en paralelo. El futuro real es una competencia constante en la que la autenticidad se verifica en lugar de darse por sentada, y las organizaciones que traten cada identidad como algo que debe confirmarse estarán mejor posicionadas para afrontarlo.
¿Cómo ayuda Shufti a las empresas a mantenerse a la vanguardia?
Shufti proporciona verificación de identidad y prevención de fraude para empresas en más de 240 países y territorios. Al combinar la verificación biométrica, las comprobaciones de presencia y el análisis de medios sintéticos mediante IA, Shufti ayuda a las organizaciones a confirmar que la persona detrás de una pantalla es real, está presente y es quien dice ser, de modo que se detectan rostros falsificados y voces clonadas antes de que causen daño. Para ver cómo funciona esto en la práctica, explore el enfoque de Shufti para detección de deepfake, que combina comprobaciones de vitalidad, análisis forense de documentos y señales de comportamiento en un único flujo de verificación.
Preguntas frecuentes
¿Cuáles son las señales más comunes de un deepfake?
Los signos más comunes incluyen parpadeo o movimientos oculares antinaturales, desenfoque en la unión del rostro con el cabello o el cuello, piel con apariencia demasiado lisa o cerosa, movimientos labiales que no coinciden con el audio, iluminación y sombras inconsistentes, y un tono monótono o robótico en voces clonadas. Las pistas contextuales, como una solicitud urgente o inusual, suelen ser la señal de alerta más clara.
¿Cuáles son los riesgos de los deepfakes?
Entre los riesgos se incluyen el fraude de identidad y el robo de cuentas, las pérdidas financieras derivadas de la suplantación de identidad y las estafas de pagos autorizados, la difusión de desinformación y la manipulación política, el daño a la reputación de personas y marcas, el contenido sintético no consensuado y una erosión más generalizada de la confianza en el audio y el vídeo auténticos.
¿Cualquiera puede crear un deepfake sin conocimientos técnicos?
Sí, y esto es lo que más ha cambiado el perfil de riesgo en los últimos años. Antes, producir un deepfake requería conocimientos de aprendizaje automático, un gran conjunto de datos y una gran capacidad de procesamiento. Hoy en día, las aplicaciones de deepfake para consumidores pueden generar un intercambio de rostros o una voz clonada desde un teléfono inteligente en minutos, sin necesidad de conocimientos técnicos ni de programación.
