郑州大学学报(理学版)  2026, Vol. 58 Issue (4): 11-18  DOI: 10.13705/j.issn.1671-6841.2025064

引用本文  

王军, 李怡豪, 吕鹏祥. 基于FakeDetect-MobileNet模型的虚假图像检测研究[J]. 郑州大学学报(理学版), 2026, 58(4): 11-18.
WANG Jun, LI Yihao, LYU Pengxiang. Research on Fake Image Detection Based on the FakeDetect-MobileNet Model[J]. Journal of Zhengzhou University(Natural Science Edition), 2026, 58(4): 11-18.

基金项目

河南省科技攻关项目(262102210130)

作者简介

王军(1980— ),男,教授,主要从事人工智能与大数据研究,E-mail: zzwjun@126.com

文章历史

收稿日期:2025-06-19
基于FakeDetect-MobileNet模型的虚假图像检测研究
王军, 李怡豪, 吕鹏祥    
郑州航空工业管理学院 大数据科学研究院 河南 郑州 450046
摘要:深度伪造技术的快速发展对虚假图像检测提出了准确性与计算效率的双重挑战。针对传统深度学习模型计算复杂度高、难以在移动设备实时部署的问题,提出轻量级检测模型FakeDetect-MobileNet。该模型基于MobileNetV3架构,采用两阶段训练策略:第一阶段冻结预训练特征提取层仅训练分类层;第二阶段全网络微调,同时,采用数据增强和多种正则化技术防止过拟合提升模型泛化能力。实验结果表明,在Kaggle Deepfake Images数据集上,FakeDetect-MobileNet检测准确率为97.34%,模型参数量仅3.99×106,CPU端推理速度达11 frame/s。与主流模型相比,参数量分别比EfficientNetB0和DenseNet121减少25.7%和50.7%,推理延迟分别降低了31%和58%。该模型在保持高检测精度的同时大幅降低资源消耗,特别适合移动设备部署。
关键词虚假图像检测    深度伪造    MobileNetV3    轻量级网络    
Research on Fake Image Detection Based on the FakeDetect-MobileNet Model
WANG Jun, LI Yihao, LYU Pengxiang    
Big Data Science Research Institute, Zhengzhou University of Aeronautics, Zhengzhou 450046, China
Abstract: The rapid advancement of deepfake technology presents dual challenges of accuracy and computational efficiency for deepfake image detection. To address the high computational complexity of traditional deep learning models and their difficulty in real-time application on mobile devices, a lightweight detection model FakeDetect-MobileNet was proposed, based on the MobileNetV3 architecture. This model employed a two-stage training strategy: Stage 1 to train only the classification layer by freezing the pre-trained feature extraction layers and; Stage 2 to perform fine-tuning of the entire network. Overfitting was mitigated through data augmentation and multiple regularization techniques, improving the model′s generalization capability. Experimental results on the Kaggle Deepfake Detection dataset demonstrate FakeDetect-MobileNet achieve a detection accuracy of 97.34%, with only 3.99 million parameters and a CPU-based inference speed of 11 FPS. Compared to mainstream models, it reduce parameter count by 25.7% and 50.7% compared with EfficientNetB0 and DenseNet121, respectively, while reducing inference latency by 31% and 58%. By maintaining high detection accuracy while significantly reducing resource consumption, this model is particularly suitable for mobile device deployment, providing a practical solution for real-time applications such as social media content moderation and news image verification.
Key words: fake image detection    deepfake    MobileNetV3    lightweight network    
0 引言

互联网与社交媒体改变了信息的传播方式,但也为虚假信息的扩散提供了便利渠道。与文字信息相比,图像因其直观性和视觉冲击力更易传播,也更容易对公众造成误导。Groh等[1]研究表明,普通人检测深度伪造视频的平均准确率仅为65.6%。深度伪造技术(deepfake)为虚假图像检测带来了更为严峻的挑战,Heidari等[2]指出人类对深度伪造图像的平均检测准确率仅为62%,可见仅依靠人工审核方式已无法有效应对虚假内容的威胁。

针对这些挑战,研究人员提出了多种检测方法。在深度学习架构方面,Soudy等[3]的CVT-CNN混合架构实现了97%的准确率。Lanzino等[4]提出的二值神经网络将计算复杂度减少至原来的1/20。Balafrej等[5]提出的轻量级SRNet架构达到95.95%准确率。国内学者也取得了重要进展,如李和激[6]提出的孪生网络频域信息融合方法。在多模态检测方面,王军等[7]提出的行为图谱多注意力(behavior-graph multi-attention, BGMA)模型通过整合文本内容特征和用户行为特征来检测虚假新闻,达到84.6%准确率,现有方法普遍存在计算复杂度高、难以在资源受限的设备部署的问题。针对这一技术瓶颈,轻量级深度学习架构的出现提供了新的解决思路。2019年,MobileNetV3[8]融合了神经架构搜索(neural architecture search, NAS)和硬件感知设计,在ImageNet上的Top-1准确率达到75.2%,同时模型大小仅为5.4 MB。王军等[9]指出世界模型是能够理解和预测环境动态的神经网络系统,其在表征学习方面的优势可为虚假内容检测提供新思路。高晗等[10]提出结合残差网络和卷积块注意力模块的静态图像行为识别方法,在PPMI数据集上的平均识别精度达到77.93%,验证了注意力机制在图像识别任务中的有效性。

本文提出FakeDetect-MobileNet模型,旨在实现移动端虚假图像的实时检测,该模型以MobileNetV3-Large为骨干网络,采用两阶段训练方法有效利用迁移学习。

1 相关技术 1.1 MobileNetV3概述

2019年,Google团队提出第三代轻量化网络架构MobileNetV3[8]。其核心创新在于采用神经架构搜索与人工设计相结合的混合方法。利用网络附加存储技术自动优化各层配置,包括卷积核尺寸、扩展系数及SE(squeeze-and-excitation)模块,并辅以人工优化改进网络结构。该混合设计使MobileNetV3-Large较MobileNetV2在ImageNet分类任务中准确率提升3.2%,推理时延降低20%。

本研究基于MobileNetV3-Large(5.4 M参数)的特征提取部分,设计了优化的轻量级分类,最终的模型参数量为3.99 M。这种轻量级设计理念在计算机视觉的其他领域也得到了广泛的应用和验证[11],证明了在保持性能的同时降低计算复杂度的可行性。虚假图像检测需识别细微的生成痕迹,如不自然的纹理过渡与异常的光影关系等,这些特征往往体现在高层语义信息里,需要更深的网络结构与更丰富的特征表示。因此,本研究选择MobileNetV3-Large作为基础架构,其输出的960维特征向量相较于Small版本的576维能够保留更多关键信息。

1.2 MobileNetV3的核心技术

MobileNetV3的成功得益于几项关键技术创新,如图 1所示。这些创新包括改进的倒残差结构、SE模块、h-swish激活函数、优化的网络结构以及最后阶段设计。

图 1 MobileNetV3的核心架构 Fig. 1 The core architecture of MobileNetV3

首先,优化倒残差结构。在MobileNetV2基础上,MobileNetV3采用NAS技术优化各层扩展比率与架构组合。该策略在保持网络轻量级的同时增强了特征提取能力。SE模块的引入是另一个重要创新。传统卷积网络对所有特征通道同等对待,而SE模块则通过全局平均池化和两个全连接层实现通道级注意力机制,能够自适应调整不同通道的重要性权重[12]。在本研究的虚假图像检测中,这种注意力机制帮助模型更聚焦于可能存在篡改痕迹的关键区域。

在激活函数的选择上,MobileNetV3引入了硬件友好的h-swish激活函数,定义为

$ \text { h-swish }(\boldsymbol{x})=\boldsymbol{x} \cdot \frac{\operatorname{ReLU6}(\boldsymbol{x}+3)}{6} 。$ (1)

相比swish函数,h-swish规避了复杂的指数运算。Dubey等[13]指出,h-swish作为swish的硬件友好型变体,在移动设备上降低了计算开销,同时保持了swish函数的大部分优势。MobileNetV3在深层使用h-swish,在浅层继续使用线性整流单元(rectified linear unit, ReLU),兼顾了准确率与推理速度。

深度可分离卷积(depthwise separable convolution,DSC)是MobileNetV3的核心技术之一,它将标准卷积分解为深度卷积和逐点卷积两个步骤。相比标准卷积,这种分解方式可将计算量大幅度降低。

SE模块通过三步实现通道注意力机制:首先,通过全局平均池化压缩空间信息来获得通道特征描述符;其次,利用两个全连接层捕获通道间的非线性关系;最后,将学习到的权重作用于原始特征实现特征重标定。

MobileNetV3-Large的网络结构设计通过增加网络深度与调整通道宽度进行优化,特别是在网络后期采用960通道,提升了高级语义特征学习能力,推理延迟较MobileNetV2降低约15%,进一步提升了模型的实用性。

2 模型构建 2.1 数据来源与预处理 2.1.1 数据来源

本研究使用的数据集来自Kaggle平台的Deepfake Images公开数据集(Bhargava, 2023)[14]。该数据集包含11 790张图像(5 893张真实图像和5 897张AI生成的伪造图像),专门用于虚假图像检测研究。伪造图像全部采用生成对抗网络(generative adversarial networks, GANs)技术生成,包含多种典型的AI合成特征,可为模型提供多样化的伪造样本。

为确保实验的科学性,采用分层随机抽样方法将11 790张图像按7 ∶1.5 ∶1.5的比例划分为训练集、验证集和测试集。其中训练集包含8 253张图像(4 123张真实图像和4 130张虚假图像),验证集包含1 768张图像(885张真实图像和883张虚假图像),测试集包含1 769张图像(885张真实图像和884张虚假图像)。各子集中真假图像比例保持约1 ∶1的平衡分布。

2.1.2 数据预处理

为确保模型训练的有效性和评估的可靠性,本研究对数据进行了系统性预处理,包括图像标准化、数据子集划分及类别不平衡处理。

首先,所有输入图像均被统一缩放为MobileNetV3架构要求的224×224像素分辨率。随后,利用该架构提供的preprocess_input()函数对图像进行标准化处理,将像素值从原始的[0, 255] 整数范围线性转换至[-1, 1]的浮点范围,以满足模型对输入数据的特定分布要求。

其次,为确保训练、验证和测试子集中真实图像与伪造图像的比例平衡,数据集划分采用了分层随机抽样。该方法根据样本类别标签(真实或虚假)进行分层,确保在生成训练集、验证集和测试集时,各子集内部均能严格维持原始数据中两类样本的分布比例,均保持1 ∶1。该方法可避免由数据划分偏差导致模型评估结果失真。

最后,针对训练数据中类别不平衡问题,采用基于类别频率的权重调整策略。核心是为训练集的每个类别赋予权重系数,该系数与该类别的样本数成反比,从而使样本量较少的类别在模型训练时能获得更高权重。此权重直接应用于损失函数计算,引导模型优化时均衡关注正负样本,防止其偏向多数类。相比过采样或欠采样等直接修改样本的方法,该策略的优势是有效缓解类别不平衡的同时,保留了原始数据分布,避免了人为引入偏差。

2.2 FakeDetect-MobileNet模型设计 2.2.1 FakeDetect-MobileNet模型架构

FakeDetect-MobileNet模型基于迁移学习的设计,由四个模块构成,如图 2所示。该模型以预训练MobileNetV3-Large作为特征提取骨干网络,去除了原有的分类层。

图 2 FakeDetect-MobileNet模型架构图 Fig. 2 FakeDetect-MobileNet model architecture diagram

特征提取将224×224×3输入图像编码为7×7×960特征图,经全局平均池化压缩为960维的特征向量。分类层采用1 024个全连接层,结合ReLU激活函数、L2正则化、批归一化(batch normalization,BN)和50%的丢弃率,最终通过Softmax归一化指数函数,输出二分类预测结果。这种设计有效减少了模型参数量并降低了过拟合风险。同时,通过对特征通道进行空间平均操作,增强了模型对图像空间变换的鲁棒性。

2.2.2 两阶段训练策略

FakeDetect-MobileNet模型采用两阶段式训练策略,旨在充分利用预训练模型知识,并避免在有限数据集上产生过拟合问题。

第一阶段(初始训练):冻结MobileNetV3-Large基础网络的所有层,仅训练新添加的分类模块(包括全连接层、批归一化层和输出层)。使用相对较高的学习率(1e-3)和AdamW优化算法(权重衰减1e-5)快速调整分类层权重,使其适应虚假图像检测的特定要求。配合提前终止策略(容忍轮次patience为7),在验证损失停止改善时及时终止训练。预训练模型的底层特征具有良好的通用性,冻结这些层能够有效避免模型在小规模数据集上的过拟合。

第二阶段(微调):解冻整个网络的所有层,使用1e-5学习率进行端到端训练。采用15轮patience值以确保充分学习,同时继续使用AdamW优化器和类别权重平衡。配合ReduceLROnPlateau学习率调度策略,当验证损失在连续7轮内没有改善时,将学习率降低为原来的20%,最低可降至1e-8。实验结果表明,这种渐进式微调策略能够在保持网络稳定性的同时,提高特定任务的性能。

2.2.3 FakeDetect-MobileNet算法实现

为了将上述设计理念转化为可执行算法,本研究设计了一个两阶段训练策略。整个算法以预训练MobileNetV3-Large权重为起点,通过渐进学习策略实现对虚假图像检测的适配。算法具体步骤为

$ \boldsymbol{F}_{\text {base }}={ MobileNetV3 }\left(\boldsymbol{X}_{\text {input }}\right), $ (2)

其中:输入图像$ \boldsymbol{X}_{\text {input }} \in \mathbf{R}^{224 \times 224 \times 3}$,输出$ \boldsymbol{F}_{\text {base }} \in \mathbf{R}^{7 \times 7 \times 960}$的特征图。

随后通过全局平均池化压缩空间维度,即

$ \boldsymbol{F}_{\text {pool }}(k)=\frac{1}{7 \times 7} \sum\limits_{i=1}^7 \sum\limits_{j=1}^7 \boldsymbol{F}_{\text {base }}(i, j, k), k=1, 2, \cdots, 960 。$ (3)

分类头的计算过程涉及多个正则化步骤。首先是带L2正则化的全连接变换,即

$ \boldsymbol{F}_{\mathrm{fc}}=\operatorname{ReLU}\left(\boldsymbol{W}_{\mathrm{fc}} \cdot \boldsymbol{F}_{\mathrm{pool}}+\boldsymbol{b}_{\mathrm{fc}}\right), $ (4)

$ \boldsymbol{W}_{\mathrm{fc}} \in \mathbf{R}^{1\;024 \times 960}$的权重在训练时受到L2惩罚项$ \lambda\left\|\boldsymbol{W}_{\mathrm{fc}}\right\|_2^2$的约束(λ=10-5),随后经过批归一化层稳定特征分布。

训练时应用50%概率的丢弃率防止过拟合,最终通过Softmax得到类别概率分布,即

$ P(y \mid X)=\operatorname{Softmax}\left(\boldsymbol{W}_{\text {out }} \cdot \boldsymbol{F}_{\text {drop }}+\boldsymbol{b}_{\text {out }}\right), $ (5)

其中:$ \boldsymbol{W}_{\text {out }} \in \mathbf{R}^{2 \times 1\;024}$为输出层权重矩阵,$ \boldsymbol{b}_{\text {out }} \in \mathbf{R}^2$为输出层偏置向量。

基于上述设计理念,本研究实现了FakeDetect-MobileNetV3的训练方法。算法以预训练MobileNetV3-Large权重 Wpre、训练集 Dtrain与验证集 Dval为输入,输出训练后的检测模型M。

算法执行流程包括以下步骤:首先构建模型架构,在冻结的MobileNetV3-Large基础上依次添加全局平均池化层、含正则化的全连接层(1 024维)、批归一化层、丢弃层(0.5)和二分类输出层。随后进入初始训练阶段(1~20轮),采用AdamW优化器仅更新分类头参数,并设置早停条件(patience=5)。待分类头收敛后,算法进入微调阶段(21~80轮),解冻全部网络层进行端到端优化,同时启动学习率自适应衰减机制:每3轮验证损失无改善时将学习率降低至80%,直至满足终止条件(patience=15),返回最优模型。

该方法将迁移学习的渐进式训练思想转化为可操作计算流程,保证模型训练的稳定性和有效性。

2.3 模型训练与优化 2.3.1 训练参数与优化器设置

在训练参数配置方面,本研究采用了针对轻量级网络特性优化设置。模型使用AdamW优化器,权重衰减系数设置为1e-5,这种配置有助于防止过拟合。训练过程分为两个阶段:第一阶段采用较高的学习率(1e-3)进行初始训练,共20个epoch;第二阶段则将学习率降低至1e-5进行微调,最多训练60个epoch。损失函数选用标准的分类交叉熵(categorical cross-entropy),批次大小设定为32。

为确保训练的稳定性和效率,采用动态早停策略。并配合ReduceLROnPlateau学习率调度器,当验证损失平台期时自动将学习率降至原来的20%(衰减因子为0.2),实现训练过程自适应优化。AdamW优化器通过权重衰减与梯度计算解耦,直接作用于参数本身而非梯度,从而有效控制模型复杂度。

批大小设定为32,这是基于GPU显存限制与梯度稳定性之间的权衡。损失函数采用标准分类交叉熵损失,可有效衡量预测概率分布与真实标签分布之间的差异,指导模型优化。

2.3.2 数据增强与正则化

针对训练数据有限的问题,本研究实施了系统化的数据增强策略。如图 3所示,增强操作包括±30°角度随机旋转,±20%范围内的平移变换,20%范围内的剪切变换,±20%的尺寸调整,随机水平翻转以及0.8至1.2倍的亮度调整。这些变换模拟了不同的拍摄条件和图像处理情况,增强了模型的泛化能力。

图 3 数据增强示例 Fig. 3 Data augmentation example

在正则化技术方面,如图 4所示,模型的分类决策模块综合应用了多种正则化技术。首先,在1 024个神经元的全连接层上应用L2权重正则化(参数kernel_regularizer=l2(1e-5)),通过限制权重大小促使模型学习更平滑的决策边界。其次,批量归一化层置于全连接层之后,不仅加速了训练收敛,还通过归一化中间特征的分布提供了额外的正则化效果。最后,丢弃度正则化以50%丢弃率应用于批量归一化层之后,通过随机失活部分神经元防止特征间过度依赖。这种多层次的正则化策略确保了模型在有限的训练数据上能够学习到具有良好泛化能力的特征表示。

图 4 正则化技术示意图 Fig. 4 Schematic diagram of regularization techniques
3 实验与结果分析 3.1 实验设置与硬件环境

实验在配备NVIDIA RTX 4060显卡的工作站上进行,处理器为Intel Core i7-10700KF,配备32 GB DDR4内存,操作系统为Windows 11操作系统。采用TensorFlow 2.14.0深度学习框架,以及Keras 2.4.3高级API进行模型构建。代码采用Python 3.11编写,依赖numpy、pandas、scikit-learn、matplotlib和opencv-python等常用科学计算库进行数据处理和可视化。该配置满足深度学习模型训练的计算需求,确保实验的可重复性。

3.2 模型实验结果与分析 3.2.1 训练过程分析

图 5为模型完整的训练过程,包含损失率、准确率、精确率和召回率四个关键指标在80轮训练中的变化趋势。第一阶段(1~20轮)通过冻结预训练网络快速收敛,损失从1.0降至0.4,准确率达90%以上。第二阶段(21~80轮)全网络微调后,训练和验证准确率分别稳定在98%和97%,差值仅为1个百分点,表明模型泛化良好。

图 5 FakeDetect-MobileNet训练历史 Fig. 5 FakeDetect-MobileNet Training History
3.2.2 测试集性能评估

在评估模型性能时,采用了虚假图像检测领域的标准评价指标体系。主要关注四个核心指标:准确率(Accuracy)=(TP+TN)/ (TP+TN+FP+FN);精确率(Precision)= TP/(TP+FP);召回率(Recall)=TP/(TP+FN);F1分数=2×(Precision×Recall)/(Precision+Recall)。其中,TP表示正确识别的虚假图像数,TN为正确识别的真实图像数,FP是真实图像被误判为虚假的数量,FN则是虚假图像被误判为真实的数量。

模型在独立测试集上的评估结果如表 1所示。

表 1 测试集上的详细分类性能报告 Tab. 1 Detailed classification performance report on the test set

从分类报告可以看出,模型在识别虚假图像方面表现出较高的召回率(97.85%),能够检测出大部分虚假内容。在识别真实图像方面,模型展现出较高的精确率(97.83%)。图 6展示了测试集上的混淆矩阵,提供了模型预测错误的直观表示。

图 6 测试集上的混淆矩阵 Fig. 6 Confusion matrix on the test set

在1 769个测试样本中,模型出现47例错误预测,其中19个伪造图像被误判为真实,28个真实样本被误判为虚假。进一步分析表明,模型的特异性(specificity)为97.85%,灵敏度(sensitivity)为96.83%。

3.3 与主流模型的对比分析 3.3.1 测试集性能评估

表 2比较了FakeDetect-MobileNet与主流卷积神经网络模型的架构参数。参数效率分析表明,FakeDetect-MobileNet具有显著轻量化优势:其参数量较EfficientNetB0减少25.7%,较DenseNet121减少50.7%。

表 2 各模型架构参数对比 Tab. 2 Comparison of architecture parameters among various models

在计算复杂度方面,FakeDetect-MobileNet模型仅需0.39 GFLOP(十亿次浮点运算),显著提高了计算效率。该计算效率的提升对于资源受限设备尤为重要。

FakeDetect-MobileNet的CPU推理时间为90.56 ms (约11 fps),较EfficientNetB0快31.2%,较DenseNet121快1.4倍。该速度优势使其更适合实时应用场景。

FakeDetect-MobileNet模型文件大小仅为15.87 MB,分别为EfficientNetB0和DenseNet121的75.6%与49.9%,易于在移动设备上部署和更新。

3.3.2 检测性能对比

表 3总结了各模型在相同数据集上的检测性能。

表 3 各模型检测性能对比 Tab. 3 Comparison of detection performance among various models

实验结果显示,FakeDetect-MobileNet模型在虚假图像检测任务中展现出出色的综合性能,准确率达到97.34%,超过了EfficientNetB0模型(97.12%)和DenseNet121模型(96.61%)。与EfficientNetB0相比,FakeDetect-MobileNet模型以74.3%的参数规模实现了更高的准确率,同时推理耗时降低了31.2%。这种在模型轻量化、检测准确性和推理速度方面的综合优势,充分展现了优化设计的轻量级网络架构的巨大潜力。

数据分析表明,DenseNet121虽然参数量是FakeDetect-MobileNet的2.03倍,计算复杂度更是高14倍,但其检测准确率为96.61%,这证明了模型规模与性能之间并非简单的正相关关系。原始MobileNetV3模型(未针对任务优化)准确率为91.86%,而FakeDetect-MobileNet准确率达到97.34%,表明针对虚假图像检测任务的专用优化的重要性。

4 模型性能分析与局限性

模型取得优异性能的关键因素之一在于SE模块在伪造图像检测任务中的有效应用。SE模块通过全局信息建模和通道间相关性学习,使模型能够自适应地强化与伪造特征相关的通道响应。双阶段训练策略有效利用了预训练模型的通用视觉特征,避免了小样本训练的过拟合风险。第一阶段的冻结训练确保了底层特征提取器的稳定性,第二阶段的全局微调则允许模型针对虚假图像的特征模式进行深层优化。

在性能方面,模型在保持轻量级设计的同时满足实时性需求。3.99 M的参数量使得模型可以轻松部署在内存受限的移动设备上,而90.56 ms的推理延迟确保了用户体验的流畅性。模型基于标准深度学习框架而实现,部署难度低。L2正则、批归一化和丢弃率的组合使用保证了模型的泛化能力。然而,该模型也存在一定的局限性。深度可分离卷积层虽然有效降低了计算复杂度,但在特征分离过程中可能丢失通道间的特征关联,影响对复杂伪造特征的识别。训练数据集主要来自GAN生成的图像,模型对其他生成技术(如扩散模型)的泛化能力有待验证。随着Stable Diffusion等基于扩散模型的图像生成技术的快速发展,该模型的泛化性面临新的挑战。

5 结语

本研究提出的FakeDetect-MobileNet模型实现了97.34%检测精度,参数量仅为3.99 M,推理延迟为90.56 ms,证明了轻量级模型在虚假图像检测任务中的有效性。实验结果表明,通过合理的架构设计和训练策略,轻量级模型完全可以在保持高检测精度的同时,显著降低计算资源需求,为虚假内容检测的实际应用提供了可行性。本研究的主要创新点包括三个方面:将轻量级网络应用于虚假图像检测领域;提出有效的训练策略;验证综合正则化技术在提升模型泛化能力方面的有效性。这些为资源受限环境下的深度学习应用提供了参考。未来研究可从以下方面展开:引入多模态信息融合,结合图像的元数据、社交传播模式等辅助信息,提高检测的全面性与准确性;开发增量学习机制,使模型能够持续适应新型伪造技术,特别是针对快速发展的生成式AI技术;研究更高效的模型压缩技术,进一步降低部署成本。同时,建立标准化的虚假图像检测基准测试集,推动该领域研究的规范化发展,也是亟待解决的重要问题。

参考文献
[1]
GROH M, EPSTEIN Z, FIRESTONE C, et al. Deepfake detection by human crowds, machines, and machine-informed crowds[J]. Proceedings of the national academy of sciences of the United States of America, 2022, 119(1): e2110013119. (0)
[2]
HEIDARI A, JAFARI NAVIMIPOUR N, DAG H, et al. Deepfake detection using deep learning methods: a systematic and comprehensive review[J]. WIREs data mining and knowledge discovery, 2024, 14(2): e1520. DOI:10.1002/widm.1520 (0)
[3]
SOUDY A H, SAYED O, TAG-ELSER H, et al. Deepfake detection using convolutional vision transformers and convolutional neural networks[J]. Neural computing and applications, 2024, 36(31): 19759-19775. DOI:10.1007/s00521-024-10181-7 (0)
[4]
LANZINO R, FONTANA F, DIKO A, et al. Faster than lies: real-time deepfake detection using binary neural networks[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. Piscataway: IEEE Press, 2024: 3771-3780. (0)
[5]
BALAFREJ I, DAHMANE M. Enhancing practicality and efficiency of deepfake detection[J]. Scientific reports, 2024, 14: 31084. DOI:10.1038/s41598-024-82223-y (0)
[6]
李和激. 基于孪生网络的虚假图像识别方法研究[D]. 哈尔滨: 哈尔滨工程大学, 2024.
LI H J. Research on fake image recognition method based on siamese network[D]. Harbin: Harbin Engineering University, 2024. (0)
[7]
王军, 马小越, 付红静. 基于BGMA模型社交媒体虚假新闻检测研究[J]. 郑州大学学报(理学版), 2025, 57(3): 12-18.
WANG J, MA X Y, FU H J. Research on fake news detection in social media based on BGMA model[J]. Journal of Zhengzhou university (natural science edition), 2025, 57(3): 12-18. DOI:10.13705/j.issn.1671-6841.2024092 (0)
[8]
HOWARD A, SANDLER M, CHEN B, et al. Searching for MobileNetV3[C]//2019 IEEE/CVF International Conference on Computer Vision. Piscataway: IEEE Press, 2019: 1314-1324. (0)
[9]
王军, 崔云烨, 张宇航. 世界模型研究综述[J]. 郑州大学学报(理学版), 2024, 56(5): 1-12.
WANG J, CUI Y Y, ZHANG Y H. Overview of world models[J]. Journal of Zhengzhou university (natural science edition), 2024, 56(5): 1-12. DOI:10.13705/j.issn.1671-6841.2024078 (0)
[10]
高晗, 万方杰, 马明旭. 结合ResNet和CBAM的静态图像行为识别方法[J]. 郑州大学学报(理学版), 2025, 57(3): 65-71.
GAO H, WAN F J, MA M X. Still image action recognition method combining ResNet and CBAM[J]. Journal of Zhengzhou university (natural science edition), 2025, 57(3): 65-71. DOI:10.13705/j.issn.1671-6841.2023171 (0)
[11]
王兆庆, 牛朝一, 佘维, 等. 基于被动视觉的三维重建技术研究进展[J]. 郑州大学学报(理学版), 2024, 56(5): 13-19.
WANG Z Q, NIU C Y, SHE W, et al. Progress of study on 3D reconstruction technology based on passive vision[J]. Journal of Zhengzhou university (natural science edition), 2024, 56(5): 13-19. DOI:10.13705/j.issn.1671-6841.2023012 (0)
[12]
刘佳奇, 易积政, 陈爱斌. FSDN: 基于嵌套U-Net结构的人脸阴影检测模型[J]. 郑州大学学报(理学版), 2023, 55(2): 51-56.
LIU J Q, YI J Z, CHEN A B. FSDN: a nested U-Net for face shadow detection[J]. Journal of Zhengzhou university (natural science edition), 2023, 55(2): 51-56. DOI:10.13705/j.issn.1671-6841.2021472 (0)
[13]
DUBEY S R, SINGH S K, CHAUDHURI B B. Activation functions in deep learning: a comprehensive survey and benchmark[J]. Neurocomputing, 2022, 503: 92-108. DOI:10.1016/j.neucom.2022.06.111 (0)
[14]
BHARGAVA K. Deepfake face images[EB/OL]. (2023-01-10)[2025-04-10]. https://doi.org/10.34740/kaggle/dsv/806. (0)