什么是深度伪造?人工智能生成的视频和媒体是如何运作的?
TL博士
- 深度伪造是指利用机器学习模型,通过对真实素材进行训练,生成人工智能合成的视频、图像或音频,而不是像 Photoshop 图像那样从真实素材中编辑而来。
- 深度伪造技术可以追溯到 2014 年(生成对抗网络),并在 2017 年正式命名;现在它价格低廉且速度足够快,可以在消费者应用程序中实时运行。
- 深度伪造与“廉价伪造”(简单的编辑,没有人工智能)不同,并会带来严重的风险:身份欺诈、经济损失和虚假信息,尤其是在金融服务、金融科技和保险领域。
- 常见迹象包括不自然的眨眼、口型不同步、机械式的语调以及紧急或不寻常的要求。
- 大规模检测深度伪造需要多层防御措施,例如活体检测和深度伪造检测,而不是人工审核。
什么是深度伪造?人工智能生成的视频和媒体是如何运作的?
深度伪造是一种合成媒体,最常见的是深度伪造视频、图像或音频片段,它通过人工智能生成或修改,使真人看起来像是在说或做他们从未做过的事情。该术语融合了“深度学习”和“伪造”两个词,而深度伪造人工智能发展如此迅速,以至于现在只需一小段真实视频片段或几秒钟的录音就能制作出以假乱真的伪造内容。
深度伪造技术究竟是如何运作的?
从技术层面来说,深度伪造技术是利用机器学习模型,通过对真实人物样本(例如照片、视频帧或音频录音)进行训练,最终学习到人物的可识别模式:面部轮廓、动作方式、语调和节奏。训练完成后,该模型可以按需生成新的素材,将人物置于他们从未出现过的场景、句子或音频片段中。与照片裁剪或修饰等编辑方式不同,深度伪造并非由真实素材生成,而是由模型从零开始生成,这正是深度伪造技术所利用的优势所在。 深度伪造演示和注入攻击以及为什么制作精良的深度伪造视频能够经受住仔细审查,而人工编辑的视频却无法做到。
深度伪造视频、图像和音频
深度伪造技术主要有三种形式:
- 深度伪造视频:将真人的脸或身体替换到视频素材中,或者操控他们的表情来匹配他们从未表演过的剧本。
- 深度伪造图像:对人脸、文件或场景的静止照片进行伪造或修改,使其看起来像真的一样。
- 深度伪造音频:通过一段短音频样本克隆出一个声音,并使其朗读任何文本,这项技术被广泛用于电话诈骗和社会工程诈骗中。
深度伪造技术简史
深度伪造技术并非一蹴而就。其核心技术——生成对抗网络(GAN)——由机器学习研究员伊恩·古德费洛(Ian Goodfellow)于2014年提出,当时他还是博士生。GAN 的原理是让两个神经网络相互对抗,直到其中一个生成足以以假乱真的伪造图像。“深度伪造”一词直到2017年12月才开始公开使用,当时一位匿名Reddit用户以该名称发布内容,分享人工智能操纵的视频,这项技术也因此得名,并迅速走红。短短几年内,曾经需要专门实验室才能完成的研究成果就被打包成面向消费者的应用程序,将一项小众的学术研究变成了人人都能用智能手机实现的技术。
Deepfake AI 的工作原理:生成对抗网络 (GAN) 和扩散模型?
Deepfake AI 主要由两大类模型驱动:
- 生成对抗网络(GAN):两个神经网络相互竞争。生成器生成虚假图像,而判别器则试图识别它们。在竞争过程中,生成器不断改进,直到其输出能够同时欺骗判别器,并且通常也能欺骗人类观察者。
- 扩散模型:当今许多最逼真的图像和视频生成器背后的技术。它们能够学习逆向添加噪声的过程,因此可以从随机噪声开始,逐步将其细化为照片级逼真的结果。
这两种方法都降低了准入门槛。过去需要庞大数据集和技术技能才能完成的工作,现在只需使用消费级应用程序即可完成,有时甚至可以在实时视频通话期间完成。
这种转变因以下因素而加速: 生成式人工智能深度伪造 能够在几秒钟内生成合成视频和音频的工具。
不同类型的深度伪造技术
- 换脸:在视频中,将一个人的脸映射到另一个人的头上。
- 面部重现:保留目标人物的面部特征,但其表情和头部动作由演员或剧本控制。
- 唇形同步深度伪造:修改现有视频素材,使嘴型与新音频相匹配。
- 语音克隆:仅用几秒钟的语音就能合成真实声音的副本。
- 全身和文本到视频的合成:从零开始生成完整的人物和场景,越来越多地通过简单的文本提示生成。
深度伪造与廉价伪造:区别为何如此重要?
并非所有篡改过的视频都是深度伪造。研究人员使用“廉价伪造”(有时也称为“浅层伪造”)一词来指代那些使用简单、低成本的方法而非机器学习技术进行篡改的媒体:例如,将视频片段从上下文中剪掉、减慢或加快视频播放速度、错误标记真实视频,或者使用基本的编辑软件替换人脸。廉价伪造完全不需要人工智能,这使得它们更容易制作,而且实际上同样能够误导观众。这种区别对于验证至关重要:廉价伪造通常可以通过检查原始来源或上下文来识别,而真正的深度伪造则需要本指南中所述的技术分析。将所有可疑视频都视为潜在的深度伪造视频,可能会忽略其背后更简单、更常见的技巧。
深度伪造技术的演变
早期的深度伪造视频需要数小时的处理时间,而且看起来仍然有瑕疵。如今,这项技术已经发生了三个方面的变化:模型所需的素材量大大减少,生成速度快到足以实时运行,而且现成的工具也已广泛普及。曾经仅限于资源雄厚的犯罪分子才能使用的威胁,现在几乎人人都能轻易获得,这就是为什么深度伪造欺诈已经从一种新奇事物演变为一种主流的商业风险。
这种转变在以下方面的兴起中显而易见: 深度伪造即服务 提供按需租用深度伪造功能的服务。
深度伪造技术有哪些风险?
深度伪造技术的风险远不止于单个虚假视频。它会造成经济、声誉和社会方面的损害。
身份欺诈和冒充
- 合成面孔和克隆声音被用来冒充客户、绕过远程注册流程、欺骗 年龄验证检查并使用盗用或捏造的身份开设账户。
财务和声誉损失
- 除了直接盗窃之外,企业还面临着退款、补救成本以及不断变化的监管环境下的监管处罚。 深度伪造法律并失去了多年来建立起来的客户信任。
错误信息和操纵
- 捏造公众人物的视频会传播虚假信息,甚至真实的视频也可能被误认为是伪造的,这种影响会逐渐削弱公众的信任。
网络诈骗中如何使用深度伪造技术?
深度伪造技术常被用于诈骗,冒充受害者信任的人,从而降低他们的警惕性。常见的诈骗手法包括:
- 首席执行官和高管欺诈: 克隆的高层领导的声音或视频,授权紧急付款。
- 冒充家人和朋友: 克隆人发出求救电话,索要钱财。
- 爱情骗局和投资骗局: 构建合成角色以逐步赢得信任。
- 虚假代言: 利用深度伪造技术,让名人或官员宣传加密货币和交易计划。
- 验证绕过: 利用虚假自拍和视频绕过远程身份验证。
规模是真实存在的。2024年,工程公司奥雅纳的一名财务员工在参加了一个完全由高级同事的深度伪造视频会议后,被骗转账约25万美元。
在合成身份进入您的系统之前就将其拦截。
人工审核已无法应对现代伪造技术。Shufti 利用人工智能驱动的活体检测和演示攻击分析技术,在注册过程中实时识别深度伪造内容,为 240 多个国家和地区的用户提供身份验证。
哪些行业受深度伪造技术的影响最大?
任何依赖信任个人身份或形象的行业都会受到攻击,但有些行业受到的攻击尤为严重:
- 金融服务和银行业务: 开户、付款授权和大额转账。
- 金融科技和加密货币: 快速远程注册和不可逆交易。
- 保险: 利用篡改的图片和视频进行虚假宣传。
- G政府和公共服务: 福利欺诈和身份盗用。
- 媒体和娱乐: 声誉攻击和捏造事实。
- 电信: 支持SIM卡交换和账户盗用诈骗。
- 零工经济和共享经济: 伪造司机、主机和工作人员身份。
远程 KYC 入职审核是这份名单上所有行业的共同点。
深度伪造最常见的迹象有哪些?
虽然高明的伪造品很难用肉眼识别,但许多深度伪造技术仍然会留下蛛丝马迹。了解常见的伪造迹象有助于个人和团队保持警惕。
视频和图像中的视觉符号
- 眨眼不自然,或者眼睛无法持续追踪或反射光线。
- 脸部与头发、耳朵、眼镜或领口交接处出现模糊或扭曲。
- 皮肤看起来过于光滑、蜡状,或者与光线不协调。
- 嘴唇动作略微不同步,或者牙齿扁平、轮廓不清晰。
- 画面边缘闪烁,阴影在帧与帧之间出现奇怪的偏移。
音频指示牌
- 语调平淡或机械,伴有不寻常的停顿或重音。
- 背景噪音断断续续,听起来很不自然。
- 呼吸音和口音缺失或错位。
语境符号
- 紧迫性、保密性或迅速行动的压力。
- 不寻常的要求,尤其是涉及金钱或凭证的要求。
- 与该人通常的沟通方式不符的沟通渠道或行为。
这些人工检查对个人有所帮助,但无法大规模应用。一家需要验证成千上万人身份的企业不可能逐一检查每张自拍或视频是否存在变形和闪烁。需要自动且大规模地检测合成媒体的组织依赖于专门开发的系统。 活力检测 并将深度伪造检测作为身份验证流程的一部分。
深度伪造内容会变得无法与真实内容区分开来吗?
深度伪造技术已经足以以假乱真,随着生成成本和速度的提升,其质量还会不断提高。但它们不太可能变得完全无法辨别真伪。与此同时,内容认证、数字水印和多层验证等溯源标准也在不断发展。现实的未来将是一场持续的竞争,真实性需要验证而非想当然,而那些将每个身份都视为需要核实的对象而加以重视的机构将更有能力应对挑战。
Shufti 如何帮助企业保持领先地位?
Shufti 为 240 多个国家和地区的企业提供身份验证和欺诈防范服务。通过结合生物识别验证、活体检测和人工智能驱动的合成媒体分析,Shufti 帮助企业确认屏幕背后的用户是否真实存在,是否与他们声称的身份相符,从而在伪造面孔和克隆声音造成损害之前将其拦截。要了解其实际运作方式,请探索 Shufti 的方法。 深度检测它将活体检测、文档取证和行为信号结合在一个验证流程中。
常見問題解答
深度伪造视频最常见的特征有哪些?
最常见的迹象包括不自然的眨眼或眼球运动、脸部与头发或颈部交界处的模糊、皮肤看起来过于光滑或蜡状、嘴唇动作与音频不符、光线和阴影不一致,以及克隆声音中出现的平淡或机械的音调。语境线索,例如紧急或不寻常的要求,往往是最强烈的警告信号。
深度伪造技术有哪些风险?
风险包括身份欺诈和账户盗用、冒充他人和授权推送支付诈骗造成的经济损失、虚假信息的传播和政治操纵、对个人和品牌的声誉损害、未经同意的合成内容,以及对真实音频和视频的信任度普遍下降。
任何人都能在不具备技术技能的情况下制作深度伪造视频吗?
是的,这正是近年来风险状况变化最大的因素。过去,制作深度伪造视频需要机器学习专业知识、庞大的数据集和强大的计算能力。而如今,消费者可以使用智能手机,在几分钟内生成换脸或克隆语音,无需任何编程或技术背景。
