Instrument panel detection method for oilfield injection station based on improved target detection model
-
摘要:
在油田配注站场的夜间作业环境中,仪表盘目标检测受限于低光照条件,导致传统单模态图像检测方法在准确性与鲁棒性方面表现不佳。本文提出了一种改进快速区域卷积神经网络(faster region-based convolutional neural networks, Faster R-CNN)的中期融合双分支目标检测模型,旨在融合可见光图像与夜视图像的互补信息,提升夜间低对比度环境下的目标检测性能。设计针对可见光与夜视图像的双分支中期融合策略,增强双图像特征协同,通过改进轻量化的移动卷积网络为主干特征提取网络,结合空间注意力机制有效增强了关键区域的特征表达能力。在自定义油田配注站场仪表盘夜间图像数据集上的实验结果表明,该方法在mAP@0.5和mAP@0.5:0.95指标上分别达到了88.92%与46.87%,较基线Faster R-CNN模型分别提升了5.89和4.72百分点,在低对比度的夜间工业场景中展现出良好的检测精度与鲁棒性,同时降低模型的参数量,使其更容易部署在资源有限的边缘设备。
Abstract:In the night operation environment of oilfield distribution stations, instrument panel target detection is limited by low light conditions, resulting in poor performance of traditional single-modal image detection methods in terms of accuracy and robustness. This paper proposes a mid-term fusion dual-branch target detection model based on improved Faster R-CNN, which aims to fuse the complementary information of visible light images and night vision images to improve the target detection performance in low-contrast environments at night. A dual-branch mid-term fusion strategy for visible and night vision images is designed to enhance the synergy of dual image features. By improving the lightweight mobile convolutional network as the backbone feature extraction network, the feature expression ability of key areas is effectively enhanced by combining the spatial attention mechanism. Experimental results on a custom oilfield distribution station instrument panel night image dataset show that this method achieves 88.92% and 46.87% in mAP@0.5 and mAP@0.5:0.95 indicators, respectively, which are 5.89% and 4.72% higher than the baseline Faster R-CNN model, respectively. It shows good detection accuracy and robustness in low-contrast night industrial scenes, while reducing the number of model parameters, making it easier to deploy on resource-limited edge devices.
-
油田配注站场作为油田系统中必不可少的组成部分,其仪表盘数据的实时检测对保障生产安全和效率至关重要,但人工巡检效率低下且具有安全风险。这些问题都严重影响了油田配注站场的运行效率和数据准确性,因此学者们在油田配注站场运维中逐渐应用计算机视觉、深度学习和大语言模型等技术,开展仪表盘目标检测方法的研究及应用,例如王仕强等[1]的巡检机器人和李平等[2]的机器视觉应用都大幅提升了油田巡检的效率。
近年来,深度学习算法主要以可见光图像作为输入,并通常假设外部环境较为理想,以此简化检测任务。主流的目标检测方法大多基于卷积神经网络,整体可分为两大类:一类是直接进行回归预测的一阶段方法,另一类是以候选区域为基础的两阶段方法。一阶段模型将目标检测视为一个整体的回归与分类任务,直接在整张图像上进行预测,无需生成候选区域的步骤,从而能够一次性输出目标的类别与位置信息,代表模型有SSD(single shot multibox detector)[3]和YOLO(you only look once)系列[4-10],它们通过直接预测目标位置和类别实现高效检测;无锚框方法如CornerNet[11]和FCOS[12]通过关键点或逐像素回归简化流程,而基于Transformer的DETR(detection Transformer)[13]利用编码器−解码器结构增强复杂场景适应性。但在夜间低光照环境下,对小目标和低对比度特征的捕捉能力不足。两阶段目标检测模型通常首先从输入图像中生成一系列候选区域,随后对这些区域进行分类并精确回归其边界框坐标。相较于一阶段模型,这类方法在检测精度上通常具有更明显的优势,此类模型的代表有区域卷积神经网络(region-based convolutional neural networks, R-CNN)[14]、Fast R-CNN[15] 和Faster R-CNN[16]等。
虽然可见光图像在正常光照条件下能提供丰富的纹理与颜色信息[17],并实现较高的检测准确率,但在夜间、对比度较低或者小目标不明显等场景下,其图像质量和检测性能大幅下降,难以保障鲁棒性。红外图像凭借目标轮廓信息,适配暗光环境[18],但其特征表达能力有限,且易受干扰。为此引入多模态融合方法,按层次可分为像素级(Early Fusion,直接合并源像素信息,需要精确配准)、特征级(Mid‑Level Fusion,各模态先提取特征后融合)与决策级(Late Fusion,各模态独立判决后融合)[19],代表工作包括Yuan等[20]提出RGB-红外特征对齐检测器,通过跨模态对齐提升夜间检测精度;Zhu等[21]设计双分支融合框架,结合自注意力增强特征协同性;Hou等[22] 改进YOLOv7,提出双分支网络提升目标检测性能;Liu等[23]利用目标感知对抗网络优化多模态信息整合。这些目标检测方法都提高了在恶劣环境中目标检测的稳定性,但是并没有解决夜间低对比度和小目标检测的双重挑战。因此,本研究受多模态融合检测的启发,采用夜视图像与可见光图像融合并结合注意力机制的策略来提高在低对比度环境中小目标检测的精度。
然而,双分支双阶段检测模型由于分别处理双图像数据,导致参数量和计算量翻倍,难以满足高效边缘部署需求。为了解决模型高计算开销的问题,引入移动卷积网络,通过深度可分离卷积和灵活的参数调整机制,使其成为一个适合在计算资源有限的环境中部署的卷积神经网络架构。例如,MobileNetV1[24]引入了深度可分离卷积以提高效率;MobileNetV2[25]提出了线性瓶颈和倒挂残差结构;GhostNet[26]增加了深度卷积的相对频率;MnasNet[27]在瓶颈结构中集成了轻量级注意力机制;MobileOne[28]在推理时添加并重新参数化线性分支;MobileNetV3[29]通过硬件感知 NAS、NetAdapt 算法和架构进步相结合,针对移动电话 CPU 进行调优。MobileNetV4[30]通过通用倒残差块(universal inverted bottleneck,UIB)优化卷积结构增强特征表达能力。但是,目前多数移动卷积网络算法并没有针对夜间小目标检测和低对比度特征提取问题提出有效解决办法。
为解决以上问题,本文以主流双阶段目标检测模型Faster R-CNN为基本框架,对其主干网络进行改进,提出一种改进原框架的中期融合双分支目标检测模型。该主干网络以MobileNetV4为基础网络,结合空间注意力机制适用于低对比度环境中的小目标检测。此外,采用双分支结构分别提取可见光与夜视特征,在两个分支之间通过中期特征融合模块,以特征融合的方式学习各个分支所提取特征的关系与信息,从而实现可见特征与夜视特征之间的互补。该主干网络能够高效提取图像特征,并因其轻量化的特点,使得模型可以部署于资源有限的边缘设备。
1. 基本网络框架原理
R-CNN系列方法由Facebook AI研究团队的Ross Girshick首创,旨在通过深度卷积神经网络实现高精度的目标检测。其后续版本Fast R-CNN在原始R-CNN基础上实现了改进:将特征提取、边界框回归与目标分类整合至同一卷积神经网络中,有效提升了检测效率与精度。进一步发展出的Faster R-CNN模型引入区域提议网络(region proposal network, RPN),实现候选区域的端到端生成,彻底摆脱了传统选择性搜索的计算瓶颈,从而大幅提升了目标检测的速度和实用性[31]。
Faster R-CNN模型主要包含3个功能模块:第1部分为特征提取网络,利用卷积神经网络从输入图像中提取多尺度的深层语义特征;第2部分为区域提议网络,基于图像的局部纹理、颜色与几何结构等特征高效生成候选框,并输出对应的置信度得分;第3部分为分类与回归模块,对候选区域进一步进行目标类别判定及边界框精修[32]。该架构适用于油田配注站场等复杂场景中的自动化目标检测任务,具备优良的检测精度与实时性。然而,针对油田配注站场日夜间仪表盘检测的研究仍不足,现有目标检测方法难以应对低对比度和细节丢失的挑战,亟需高效、鲁棒的夜间目标检测方案。
2. 改进Faster R-CNN的中期融合双分支目标检测模型
2.1 模型总体架构
本研究所提出的中期双图像融合Faster R-CNN模型(mid-fusion dual-image Faster R-CNN, MDI-Faster R-CNN)采用了一种双分支架构设计,旨在分别对可见光图像与夜视图像进行独立处理,并于特征提取的中间阶段实现跨图像信息的中期融合。该模型以改进的MobileNetV4作为特征提取的主干网络,并集成视觉鹰眼注意力(vision eagle attention, VEA)[33]机制,在利用其轻量化与高效计算特性的同时增强对空间显著性特征的关注能力。这一架构不仅优化了多图像数据的协同表征能力,还在计算效率与检测精度间取得了平衡,为复杂工业场景下的目标检测任务提供了解决方案。模型架构如图1所示,将经过预处理后的可见光图像与夜视图像分别输入双分支主干特征提取网络,然后将特征图进行融合后输入后续检测模块,最后得到检测结果。
2.2 改进的移动卷积网络
在夜视条件下,可见光图像常因光照不足而模糊,夜视图像则面临低对比度与噪声干扰的挑战,传统特征提取方法难以有效表征目标细节。本模块通过MobileNetV4的高效多尺度特征提取能力,结合VEA的空间注意力机制,提出一种新的主干特征提取网络MobileNetV4_V,提升了低光照场景下的目标特征提取效能,同时有效抑制了背景噪声的影响。其优化目标可表述为最大化特征图中目标区域的信噪比(signal-to-noise ratio, SNR):
$$ {R}_{\text{SN}}=\dfrac{|{F}_{\text{target}}|_{2}^{2}}{|{F}_{\text{background}}|_{2}^{2}} $$ 式中:$ {F}_{\text{target}} $表示目标区域的特征强度,$ {F}_{\text{background}} $表示背景区域的特征强度。较高的SNR意味着目标特征更加突出,相对背景干扰更弱,从而提升模型对小目标的判别能力。通过VEA的动态调制,目标区域的特征响应得以强化,从而提升了后续检测任务的鲁棒性。
设输入图像为$ \boldsymbol{I}\in {\mathbb{R}}^{H\times W\times 3} $,主干网络$ \mathcal{M}(\cdot ;\Theta ) $为参数集$ \mathit{\Theta } $下的深度卷积映射函数,其输出为多尺度特征金字塔:
$$ \left\{{\boldsymbol{F}}^{\left(l\right)}\right\}_{l=2}^{5}=\mathcal{M}\left({\boldsymbol{I}};\textit{Θ}\right),{\boldsymbol{F}}^{\left(l\right)}\in {\mathbb{R}}^{\tfrac{H}{{2}^{l}}\times \tfrac{W}{{2}^{l}}\times {{C}_{l}}} $$ 式中:$ l $表示特征层级(对应下采样步长$ {2}^{l} $),$ {C}_{l} $为第$ l $层通道数。本工作聚焦于中间层 $ l=3 $(即 stride-8 特征图),用于中期融合,记双分支输出分别为$ {\boldsymbol{F}}_{\text{vis}}\in {\mathbb{R}}^{h\times w\times c} $ 与 $ {\boldsymbol{F}}_{\text{ir}}\in {\mathbb{R}}^{h\times w\times c} $,其中$ h=H/8 $,$ w=W/8 $。
为进一步增强对关键区域的空间感知能力,本文在每个UIB之后嵌入VEA模块。UIB基于 MobileNetV2 设计,包含一个 3×3 深度可分离卷积(DWConv,含批归一化(batch normalization, BN) 和 ReLU6)、一个 1×1 卷积(用于通道变换),并通过残差连接实现快捷路径。所有 UIB 均采用步长为1的卷积,除第一个 UIB 在阶段2中可能采用步长2进行下采样。给定输入特征$ \boldsymbol{F}\in {\mathbb{R}}^{h\times w\times c} $,VEA 通过局部上下文建模生成空间注意力权重图:
$$ \begin{array}{c} \begin{array}{cc} {\boldsymbol{Z}}_{1} ={\phi }_{3\times 3}\left(\boldsymbol{F}\right)\in {\mathbb{R}}^{h\times w\times c}\\ {\boldsymbol{Z}}_{2} ={\psi }_{1\times 1}\left({\boldsymbol{Z}}_{1}\right)\in {\mathbb{R}}^{h\times w\times 1}\\ \boldsymbol{A} =\sigma \left({\boldsymbol{Z}}_{2}\right)\in {\mathbb{R}}^{h\times w\times 1} \end{array} \end{array} $$ 式中: $ {\phi }_{3 \times 3}( \cdot ) $表示保持通道数不变的 3×3 深度卷积(用于捕获局部上下文信息), $ {\psi }_{1\times 1}( \cdot ) $为 1×1 卷积(用于通道压缩至标量), $ \sigma ( \cdot ) $为 Sigmoid 激活函数。最终调制后的特征表示为
$$ {\boldsymbol{F}}{'}=\boldsymbol{A}\odot \boldsymbol{F} $$ 式中:$ \odot $表示逐元素乘法(Hadamard product)。该机制通过自适应加权强化目标区域响应,同时抑制背景噪声,从而提升低对比度场景下的特征判别性。
本模块将VEA机制嵌入MobileNetV4的UIB之后,形成一种针对夜间场景优化的空间注意力增强框架,其结构如图2所示。
相较于传统全局注意力机制,VEA通过局部卷积操作显著降低了计算复杂度,其复杂度可近似为:$ O\left(H\cdot W\cdot C \cdot {k}^{2}\right) $。其中, $ H\cdot W $为特征图分辨率,C为通道数,k为卷积核大小。这一设计不仅优化了空间注意力的计算效率,还通过适配低光照低对比度场景的需求增强了模型对仪表盘等小目标的感知能力。此外,VEA与UIB的协同作用进一步提升了特征提取的层次性与表达能力,为后续中期融合提供了高质量的多图像特征支持。
2.3 中期融合模块
传统多模态融合方法存在显著局限性:早期像素级融合易导致图像特定信息的损失,尤其在夜视条件下可见光图像噪声干扰显著时更为明显;后期融合虽保留了分支独立性,但因仅在检测结果层面整合,未能充分挖掘特征级的语义协同潜力。为此,本文采用中期特征级融合策略,在主干网络中间层对双图像特征进行深度交互,兼顾细节保留与互补增益。
具体而言,设可见光分支与夜视分支经 MobileNetV4_V 主干提取的中间特征分别为 $ {\boldsymbol{F}}_{\text{vis}}\in {\mathbb{R}}^{H\times W\times C} $与$ {\boldsymbol{F}}_{\text{vis}}\in {\mathbb{R}}^{H\times W\times C} $,首先沿通道维度进行拼接:
$$ {\boldsymbol{F}}_{\text{cat}}=\left[{\boldsymbol{F}}_{\text{vis}}||{\boldsymbol{F}}_{\text{ir}}\right]\in {\mathbb{R}}^{H\times W\times 2C} $$ 随后通过轻量化 1×1 卷积进行语义对齐与降维,生成融合特征:
$$ {\boldsymbol{F}}_{\text{fused}}={\omega }_{1 \times 1}\left({\boldsymbol{F}}_{\text{cat}}\right)\in {\mathbb{R}}^{H\times W\times {{C}{'}}} $$ 式中:$ {\omega }_{1 \times 1}( \cdot ) $ 为可学习卷积核,$ {C}{'}\leqslant 2C $(本文设 $ {C}{'}=C $)。采用 1×1 卷积进行通道压缩,既保留跨模态交互后的高维信息,又控制参数增长。设融合后通道数与单分支输出一致(即 Cout = C),以维持后续 RPN 输入维度兼容性。该融合特征随后输入RPN与检测头,完成端到端训练。
本模块在中期融合策略的系统性设计及其对双图像互补性的深度挖掘,相较于早期融合的浅层像素合并和后期融合的结果级加权,中期融合在特征空间中实现信息整合,充分利用了可见光图像的纹理细节与夜视图像的轮廓及特征。其创新性可通过互信息增益加以量化:
$$ \Delta I=I\left({F}_{\text{fused}};Y\right)-\left[I\left({F}_{\text{vis}};Y\right)+I\left({F}_{\text{night}};Y\right)\right] $$ 式中:$ I\left(X;Y\right)=\mathrm{E}_{p\left(x,y\right)}\left[\log\dfrac{p\left(x,y\right)}{p\left(x\right)p\left(y\right)}\right] $为随机变量, $ X $与目标标签 $ Y $(含类别与边界框)之间的互信息。 理想情况下,$ \text{Δ}I>0 $ 表明融合过程成功挖掘了跨模态互补信息;$ \text{Δ}I $ 越大,则融合特征对下游检测任务的信息贡献越显著。该理论框架为中期融合的优越性提供了可量化、可验证的分析基础(详见第3.3.3节实验验证)。
然而,高维连续特征与离散标签间的互信息难以解析计算。为此,本文采用线性探针准确率作为$ I(F;Y) $的可微代理指标——该方法已被广泛用于表征学习中的信息含量评估[34]。具体而言,在冻结特征提取器的前提下,训练轻量线性分类头以预测目标类别,其收敛准确率与$ I(F;Y) $呈单调正相关,从而为$ \text{Δ}I $提供可操作的数值估计。
3. 实验分析
3.1 数据集与参数设置
实验基于一个油田配注站场环境的日夜间数据集展开,该数据集包含两种类型的图像,即可见光(RGB)图像和夜视图像,均以640×480的分辨率采集,并针对夜间低光照条件下的目标检测任务进行了优化。数据集总计包含
1308 对图像,每对图像由一张可见光图像及其对应的夜视图像组成,两者通过时间同步确保一致性。数据标注由人工完成,主要包括仪表盘数字的不同分布区域,共计4个类别。数据集按照8∶1∶1的比例划分为训练集、验证集和测试集,以支持模型的训练、调参及性能评估。数据集图像如图3所示。所提模型的实现采用PyTorch深度学习框架,所有实验均在一块NVIDIA RTX
4060 GPU上执行。在模型训练过程中,采用了 AdamW 优化器以实现参数的有效更新,初始学习率设定为0.01,权重衰减系数为0.0005 ,epoch为300,批次大小为4,以确保模型在自定义数据集上充分学习目标特征的深层表示,同时避免过拟合现象的发生。为提升模型的泛化能力,应用了多种数据增强技术,包括随机水平翻转、颜色抖动以及随机裁剪。测试时批次大小配置为32,以充分利用计算资源并维持梯度估计的稳定性。3.2 评估指标
为系统性地评估模型的性能,本实验采用COCO标准评估体系中的指标。
mAP@0.5:即在交并比(intersection over union,IoU)阈值设定为0.5时的平均精度均值(mean average precision, mAP)。该指标用于衡量模型在较低定位精度要求下的检测能力,特别适用于对目标大致位置具有敏感性,而对边界框精确度需求相对宽松的应用场景。平均精度(AP)的计算公式为
$$ {P}_{\text{A}}=\int\limits_{0}^{1}p\left(r\right)\mathrm{d}r $$ 式中:$ p\left(r\right) $ 表示精度–召回率曲线(precision-recall curve)中精度随召回率的函数关系。当IoU阈值固定为0.5时,mAP@0.5(PmA0.5)是对所有类别AP值的平均:
$$ P_{\mathrm{mA0.5}}=\dfrac{1}{N}\sum\limits_{i=1}^{N}{P}_{\text{A}i}\left(\text{IoU=0.5}\right) $$ 式中:N为类别总数,$ {P}_{\text{A}i} $ 为第i个类别的平均精度。此指标通过关注分类正确性与基本定位能力的结合,提供了对模型初步检测性能的有效评估。
mAP@0.5:0.95(PmA0.5:0.95):即在IoU阈值从0.5至0.95(以0.05为步长)范围内计算的平均精度的均值。该指标通过综合考量模型在不同定位精度水平下的表现,全面反映了其检测准确性与边界框精度的整体能力。其计算公式为
$$ P_{\mathrm{mA0.5:0.95}}=\dfrac{1}{\left| \mathcal {T}\right| }\displaystyle\sum_{\rm{T\in \mathcal T}}P_{\mathrm{mA}}\left(T\right) $$ 式中:$ T=\{0.5,0.55,0.6,\cdots,0.95\} $ 表示IoU阈值的集合, $ \left| \mathcal{T}\right| $ 为阈值总数,$ P_{\mathrm{mA}}\left({T}\right) $ 为在特定IoU阈值下的平均精度均值。此综合性评估方法适用于对高精度定位要求较为苛刻的场景,表明模型在多样化精度需求下的鲁棒性与适应性。
3.3 消融实验
3.3.1 与基线模型对比
为检验MobileNetV4_V对改善模型精度的效果,本文将主干网络为双分支ResNet-50[35]的模型视为基线模型,与主干网络为MobileNetV4_V的模型进行对比,在自定义油田配注站场数据集上进行测试。同时,利用其中单独日间和夜间的数据分别训练Faster R-CNN模型。实验结果如表1所示,给出了各模型在mAP@0.5和mAP@0.5:0.95指标上的表现。
表 1 与基线模型指标对比Table 1 Comparison with baseline model indicators% 模型 主干网络 mAP@
0.5mAP@
0.5:0.95Faster R-CNN(日间) ResNet-50 80.11 40.29 Faster R-CNN(夜间) ResNet-50 78.56 36.78 基线模型 双分支ResNet-50 83.03 42.15 MDI-Faster R-CNN 双分支MobileNetV4_V 88.92 46.87 注:加粗表示结果在本列最好。 实验表明,本文提出的MobileNetV4_V相比双分支 ResNet-50 在融合日间和夜间特征方面的效果更好,在mAP@0.5和mAP@0.5:0.95这2个指标上均有明显提升。在单图像模型的比较中,日间模型在本数据集上的表现相比夜间模型更为突出。而本文算法协同利用了日间和夜间信息,相比原本突出的日间模型更胜一筹,mAP@0.5和mAP@0.5:0.95分别 提升了8.81%和6.58%。
3.3.2 主干网络VEA模块数量的影响
为进一步探究MobileNetV4_V 中VEA模块对模型检测精度的影响,本节研究采用不同数量的VEA模块在双分支MobileNetV4中不同阶段嵌入。如图3所示,本节从上到下依次插入VEA模块,从而获得VM_0(不插入VEA模块)、VM_1、VM_2、VM_3(全部嵌入VEA模块,即本文算法)4个模型。表2进一步分析VEA模块数量变化影响。该结果表明,随着VEA模块数量的增加,模型目标检测的精度也在逐渐上升,在UIB后嵌入3个VEA模块时性能最优,浮点运算总数(floating point operations, FLOPs)从34.2×109增加至37.5×109,同时增长控制在合理范围。
表 2 VEA模块不同数量的模型对比Table 2 Comparison of models with different numbers of VEA modules模型 mAP@
0.5/%mAP@
0.5:0.95/%FLOPs/
109参数量/
106VM_0 84.62 42.15 34.2 18.7 VM_1 86.50 43.68 35.3 19.5 VM_2 87.03 45.10 36.4 20.3 VM_3 88.92 46.87 37.5 21.1 注:加粗表示结果在本列最好。 3.3.3 融合策略的信息增益量化分析
为实证检验所提中期融合机制在信息整合方面的优越性,本研究对比了4种典型融合范式:无融合(取单模态最优性能作为基线)、早期像素级融合(直接拼接原始图像输入)、晚期决策级融合(独立检测后加权平均置信度)、本文提出的中期特征级融合。所有变体均基于相同的 MobileNetV4_V 双分支主干与 Faster R-CNN 检测头,仅融合位置不同,以确保公平比较。
如第2.3节所述,本文采用线性探针协议估算各策略下的互信息代理值。具体实现如下:从训练完成的模型中提取 RoIAlign 后的区域特征(维度为
1024 ),在测试集上训练一个单层全连接分类器(Softmax 输出),优化器为 AdamW(初始学习率 0.01,权重衰减 1×10−4,训练 10 轮)。最终分类准确率记为$ {A}_{\text{probe}} $,并定义代理互信息增益:$$ {\text{Δ}\widehat I}={A}_{\text{fused}}-\mathrm{max}\left({A}_{\text{vis}},{A}_{\text{ir}}\right) $$ 实验结果如表3 所示。可见,本文中期融合策略取得最高的探针准确率(85.72%)与最大的信息增益($ {\text{Δ}\widehat I}=+7.42\% $),显著优于早期融合(+1.83%)与晚期融合(+4.11%)。值得注意的是, $ {\text{Δ} \widehat I} $与mAP@0.5呈强正相关(Pearson 相关系数r=0.963),表明融合特征所携带的目标相关信息量是决定检测性能的关键内在因素。该结果从信息论角度验证了中期融合在保留模态特异性细节的同时,有效激发了跨模态协同增益,从而为第2.3节的理论主张提供了坚实的实证基础。
表 3 不同融合策略的互信息增益与检测性能对比Table 3 Comparison of mutual information gain and detection performance under different fusion strategies% 融合策略 $ {A}_{\text{vis}} $ $ {A}_{\text{ir}} $ $ {A}_{\text{fused}} $ $ {\text{Δ} \widehat I} $ mAP@0.5 无融合(单模态最优) 78.30 75.60 — 0.00 80.11 早期像素融合 — — 80.13 +1.83 82.35 晚期决策融合 — — 82.41 +4.11 84.67 本文中期融合 — — 85.72 +7.42 88.92 注:加粗表示结果在本列最好。 3.4 与单阶段模型比较
表4给出了所提模型与若干代表性单阶段目标检测模型在自定义油田配注站场仪表盘日夜间数据集上的性能对比结果。MDI-Faster R-CNN在两个指标上均超过SSD[3]、RetinaNet[36]和FCOS[12],因为在严格的定位任务中,其两阶段细化和中层融合策略优于依赖焦点损失或逐像素回归的单阶段架构。 YOLOv11[11]系列模型在不同复杂度范围内进行了优化,尽管该系列模型计算效率较高,但 MDI-Faster R-CNN 在低光环境下的小目标检测中仍表现出更高的精度。该结果表明,所提出的 MDI-Faster R-CNN 模型相比于低光照条件下的一系列单阶段目标检测模型,在检测精度和定位精度方面取得了较好的进步。但是,由于其双分支网络结构比YOLOv11系列模型增加了一个夜视分支,导致在计算复杂度和参数量上略有增加。
表 4 与单阶段目标检测模型对比Table 4 Comparison with single-stage target detection models模型 主干网络 模型复杂度 mAP@0.5:0.95/%
(日间/夜间)mAP@0.5/%
(日间/夜间)FLOPs/109 参数量/106 SSD[3] VGG16 70.00 20.7 76.52/66.29 36.51/30.98 RetinaNet[36] ResNet50-FPN 193.75 33.3 82.68/75.03 42.29/36.11 FCOS[12] ResNet50-FPN 342.74 31.8 83.33/75.98 42.87/36.94 YOLOv11n[11] C3K2块 6.50 2.6 80.50/70.35 41.23/33.28 YOLOv11s[11] C3K2块 21.50 9.4 82.39/73.40 41.90/34.05 YOLOv11m[11] C3K2块 68.00 20.0 84.71/75.12 43.76/35.87 本文算法 MobileNetV4_V 37.50 21.1 88.92 46.87 注:加粗表示结果在本列最好。 3.5 与现有算法性能对比
本文算法与现有多模态融合方法在自定义油田配注站场仪表盘日夜间数据集上进行测试,验证本文算法的有效性,验证结果见表5。
表 5 本文算法与现有方法的性能对比Table 5 Performance comparison between our algorithm and existing methods% 由结果可得,本文提出的方法在检测与定位精度上均取得了最优的性能表现,验证了本文改进算法的有效性。相较于表现次优的文献[18]算法,本文方法分别在mAP@0.5和mAP@0.5:0.95上提升了 0.52 %和 1.10 %。
为直观展示所提模型在夜间低光照环境下的检测性能优势,图4给出了本文模型与YOLOv11n在典型夜视图像场景中的检测效果对比。YOLOv11n虽具有较快推理速度,但在仪表盘边缘、微小刻度等区域的检测明显漏检或框偏移;相比之下,MDI-Faster R-CNN 能准确定位小目标,并有效区分干扰区域,显示出更强的鲁棒性与空间聚焦能力。
此外,本文算法主要部署于资源有限的边缘设备,算法的复杂度是不可忽略的性能指标。本文主要围绕模型的大小,与现有方法对比讨论。采用FLOPs和参数量2个指标衡量模型体积。这两者数量越小,说明模型更容易部署,适用于资源有限的应用场景。取油田配注站场仪表盘日夜间数据集进行验证,分别与现有4种算法进行对比,模型的输入图像大小均为640像素×640像素,实验结果如表6所示。
从表6可以看出,本文算法在计算复杂度方面高于文献[22]和文献[23],但相较于文献[40]仍存在一定优化空间。在参数量方面,相较于GAFF[39]和CAPTM[40]这两种现有模型,本文算法在定位与检测精度更高的情况下,模型参数量更少、体积更小,在资源有限的边缘设备上部署方面具有一定优势。
3.6 边缘设备部署性能分析
为验证所提模型在资源受限设备上的部署可行性,本文进一步对比了各模型在 Jetson Nano 上的推理效率。考虑模型的FLOPs、参数量与结构复杂度,估算其在边缘设备上的帧率与平均推理时延。实验采用PyTorch实现,输入图像为640×640分辨率,运行环境为Jetson Nano(4GB RAM,无TensorRT加速)。性能结果如表7所示。
表 7 Jetson Nano实测性能估计对比表Table 7 Jetson Nano measured performance estimation comparison table尽管本文算法在精度上表现最佳,但其双分支结构导致推理时间高于YOLOv11n等轻量模型。考虑油田场景中多为静态监测、低频检测任务,该模型仍具备部署价值,特别是在夜间巡检的场景下。未来可通过TensorRT优化、结构剪枝等方法进一步提升实时性能。
3.7 与前沿多模态目标检测方法的对比分析
为全面评估所提 MDI-Faster R-CNN 模型在多模态工业场景下的竞争力,本文进一步将其与近年来具有代表性的先进多模态目标检测方法进行系统性对比。所选基线涵盖基于卷积架构以及注意力机制的最新成果,具体包括:MAF-YOLO[41]:一种面向红外−可见光融合的小目标检测框架,引入多尺度自适应融合模块与通道−空间协同注意力;差分多模态融合算法——MMFDet [42]:通过多分支特征提取结构、多模态差异互补模块及高层特征分割混合模块挖掘多模态数据的差异性与互补性;CM-YOLO[43]:采用跨模态适配机制,以增强对红外- RGB 模态转换的感知能力;DAFNet[44]:通过混合编码器、可逆融合模块和多尺度架构,其在标准指标上优于各类基准与先进方法,且计算效率与主流 CNN-based 方法相当。
所有对比模型均在本文构建的油田配注站场多模态数据集上进行公平训练与测试,输入图像分辨率统一为,评价指标沿用 COCO 标准下的 mAP@0.5 与 mAP@0.5:0.95。实验结果如表8 所示。
表 8 与前沿多模态目标检测方法的性能对比Table 8 Performance comparison with cutting-edge multimodal object detection methods3.8 实验结果的因果性归因分析
为进一步揭示模型性能提升的内在机理,本文从特征表示、注意力聚焦与信息流演化3个维度开展因果性归因分析。
1) 空间注意力聚焦效应可视化
图5 给出了在典型图像样本中,有/无 VEA 模块时主干网络输出特征图的 Grad-CAM 热力图可视化对比,红色区域表示高激活响应。可见,在未引入 VEA 的基线模型中,注意力分布较为弥散,易受背景噪声干扰;而嵌入 VEA 后,模型显著增强了对仪表盘数字区域与刻度边缘的响应强度,抑制了非结构化背景(如管道、支架)的激活。该现象证实,VEA 通过局部上下文建模生成的空间权重图,能够自适应强化关键语义区域,从而提升小目标的信噪比。
2) 跨模态特征互补性的层级化互信息分解
为验证中期融合策略的有效性,本文将互信息增益分析从单一输出层扩展至多尺度特征金字塔。具体而言,在 stride-8、stride-16 与 stride-32 等3个层级分别提取双分支融合前后的特征,并训练独立的线性探针分类器,记录其准确率 $ {A}_{l} $($ l=8{,}16{,}32 $)。定义层级互信息增益为
$$ \Delta {I}_{l}=A_{l}^{\text{fusion}}-\mathrm{max}\left(A_{l}^{\text{vis}},A_{l}^{\text{ir}}\right) $$ 多尺度层级互信息增益分析如表9 所示。
表 9 多尺度层级互信息增益分析Table 9 Multi scale hierarchical mutual information gain analysis% 特征层级−下采样步长 $ A_{l}^{\text{vis}} $ $ A_{l}^{\text{ir}} $ $ A_{l}^{\text{fusion}} $ $ \text{Δ}{I}_{l} $ stride-8 76.2 73.8 85.7 +9.5 stride-16 71.5 70.1 78.3 +6.8 stride-32 65.4 67.2 70.1 +2.9 可见,stride-8 层级的互信息增益最为显著,验证了本文选择该层级进行中期融合的合理性——此层级保留了丰富的空间细节,同时具备足够的语义抽象能力,最有利于可见光纹理与夜视轮廓信息的协同表达。随着下采样加深,空间信息衰减,跨模态互补效应减弱,进一步佐证了“中期”而非“晚期”融合的必要性。
3) 检测误差的结构化解耦分析
为厘清性能提升的具体贡献维度,本文对检测误差进行解耦,区分分类误差与定位误差。依据 COCO 评估协议,将 IoU < 0.5 但分类正确的预测视为定位失败,将类别错误但 IoU ≥ 0.5 的预测视为分类失败。在测试集上统计各类错误占比:基线模型(双分支 ResNet50):定位失败占 62.3%,分类失败占 37.7%;本文模型(MobileNetV4_V + 中期融合):定位失败降至 54.1%,分类失败降至 31.2%。值得注意的是,定位精度的相对提升幅度(13.2%)大于分类精度(17.2%),表明融合策略不仅增强了语义判别力,更显著改善了边界框回归的准确性。结合表9 中 stride-8 层级的高互信息增益可知,中期融合所提供的高分辨率互补特征,为 RPN 与回归头提供了更精确的空间先验,从而降低定位偏差。
综上,通过特征响应强度、层级互信息增益与误差解耦三重定量分析,本文证实性能提升源于:VEA 对目标区域特征表示的选择性增强,中期融合在最优特征层级实现跨模态信息高效整合,融合特征对定位与分类任务的双重增益。该因果归因体系不依赖不可复现的可视化假设,完全基于可测量、可重复的模型内部信号,符合工业级算法评估的严谨性要求。
4. 结束语
本文提出了一种基于中期特征融合的双模态目标检测架构——MDI-Faster R-CNN,旨在解决油田配注站场在夜间低照度、低对比度环境下仪表盘目标检测精度不足的问题。该模型以轻量化的 MobileNetV4_V 为主干网络,在其UIB后嵌入 VEA空间注意力机制,有效增强了关键区域的特征响应能力;同时,通过构建可见光与夜视图像的双分支结构,并在特征提取的中间阶段实施通道拼接与1×1卷积降维的融合策略,实现了跨模态互补信息的深度协同。实验结果表明,所提方法在自建油田配注站场多模态数据集上取得了88.92%的mAP@0.5与46.87% 的mAP@0.5:0.95检测性能,较基准模型Faster R-CNN 分别提升5.89和4.72百分点,且模型参数量控制在21.1×106,显著优于传统 ResNet50 双分支结构,在保障检测精度的同时兼顾了边缘部署的可行性。
尽管本方法在特定工业场景下展现出良好的有效性,仍存在若干局限性值得深入探讨:首先,模型对输入双模态图像的空间一致性具有较强依赖,当前实现假设可见光与夜视图像已实现像素级精确配准,而在实际部署中,因传感器位姿差异或采集时序不同步所导致的几何失配可能削弱融合增益,甚至引入干扰噪声;其次,双分支并行处理机制虽提升了特征表达的丰富性,但亦带来计算开销的显著增加,实测在 Jetson Nano 边缘平台上的推理帧率仅为 3.1 帧/s,难以满足高实时性巡检任务的需求;再次,模型训练与验证局限于特定油田环境下的仪表盘类型,其泛化能力在跨场景(如电力、化工等工业领域)或跨目标形态(如指针式、LCD 屏等)条件下尚未得到系统性验证,存在潜在的域偏移风险。
面临上述挑战,未来研究将从以下4个维度展开:1)构建可学习的跨模态对齐机制,例如引入基于可变形卷积或光流估计的自适应配准模块,以解耦模态间几何偏差对融合性能的影响;2)优化融合架构的计算效率,探索部分共享主干、动态分支选择或基于知识蒸馏的单分支近似策略,以在保持多模态增益的同时降低推理复杂度;3)拓展多场景泛化能力,通过构建涵盖多元工业仪表与光照条件的通用多模态目标检测基准,并结合无监督域自适应或元学习方法,提升模型在未知环境中的鲁棒迁移性能;4)推进边缘部署工程化落地,集成 TensorRT 加速、结构化剪枝与 INT8 量化等端侧优化技术,进一步压缩模型延迟与能耗,支撑其在资源受限工业边缘设备上的规模化应用。
-
表 1 与基线模型指标对比
Table 1 Comparison with baseline model indicators
% 模型 主干网络 mAP@
0.5mAP@
0.5:0.95Faster R-CNN(日间) ResNet-50 80.11 40.29 Faster R-CNN(夜间) ResNet-50 78.56 36.78 基线模型 双分支ResNet-50 83.03 42.15 MDI-Faster R-CNN 双分支MobileNetV4_V 88.92 46.87 注:加粗表示结果在本列最好。 表 2 VEA模块不同数量的模型对比
Table 2 Comparison of models with different numbers of VEA modules
模型 mAP@
0.5/%mAP@
0.5:0.95/%FLOPs/
109参数量/
106VM_0 84.62 42.15 34.2 18.7 VM_1 86.50 43.68 35.3 19.5 VM_2 87.03 45.10 36.4 20.3 VM_3 88.92 46.87 37.5 21.1 注:加粗表示结果在本列最好。 表 3 不同融合策略的互信息增益与检测性能对比
Table 3 Comparison of mutual information gain and detection performance under different fusion strategies
% 融合策略 $ {A}_{\text{vis}} $ $ {A}_{\text{ir}} $ $ {A}_{\text{fused}} $ $ {\text{Δ} \widehat I} $ mAP@0.5 无融合(单模态最优) 78.30 75.60 — 0.00 80.11 早期像素融合 — — 80.13 +1.83 82.35 晚期决策融合 — — 82.41 +4.11 84.67 本文中期融合 — — 85.72 +7.42 88.92 注:加粗表示结果在本列最好。 表 4 与单阶段目标检测模型对比
Table 4 Comparison with single-stage target detection models
模型 主干网络 模型复杂度 mAP@0.5:0.95/%
(日间/夜间)mAP@0.5/%
(日间/夜间)FLOPs/109 参数量/106 SSD[3] VGG16 70.00 20.7 76.52/66.29 36.51/30.98 RetinaNet[36] ResNet50-FPN 193.75 33.3 82.68/75.03 42.29/36.11 FCOS[12] ResNet50-FPN 342.74 31.8 83.33/75.98 42.87/36.94 YOLOv11n[11] C3K2块 6.50 2.6 80.50/70.35 41.23/33.28 YOLOv11s[11] C3K2块 21.50 9.4 82.39/73.40 41.90/34.05 YOLOv11m[11] C3K2块 68.00 20.0 84.71/75.12 43.76/35.87 本文算法 MobileNetV4_V 37.50 21.1 88.92 46.87 注:加粗表示结果在本列最好。 表 5 本文算法与现有方法的性能对比
Table 5 Performance comparison between our algorithm and existing methods
% 表 6 模型参数和计算复杂度的性能对比
Table 6 Performance comparison of model parameters and computational complexity
表 7 Jetson Nano实测性能估计对比表
Table 7 Jetson Nano measured performance estimation comparison table
表 8 与前沿多模态目标检测方法的性能对比
Table 8 Performance comparison with cutting-edge multimodal object detection methods
表 9 多尺度层级互信息增益分析
Table 9 Multi scale hierarchical mutual information gain analysis
% 特征层级−下采样步长 $ A_{l}^{\text{vis}} $ $ A_{l}^{\text{ir}} $ $ A_{l}^{\text{fusion}} $ $ \text{Δ}{I}_{l} $ stride-8 76.2 73.8 85.7 +9.5 stride-16 71.5 70.1 78.3 +6.8 stride-32 65.4 67.2 70.1 +2.9 -
[1] 王仕强, 余昭江, 袁建军, 等. 油气场站自动化巡检机器人系统设计[J]. 科学技术与工程, 2022, 22(36): 16123−16132. doi: 10.3969/j.issn.1671-1815.2022.36.032 WANG Shiqiang, YU Zhaojiang, YUAN Jianjun, et al. Design of automatic inspection robot system for oil and gas station[J]. Science technology and engineering, 2022, 22(36): 16123−16132. doi: 10.3969/j.issn.1671-1815.2022.36.032 [2] 李平, 马亮, 梁潇, 等. 机器视觉在油气田巡检中的应用[J]. 自动化博览, 2020, 37(3): 87−89. LI Ping, MA Liang, LIANG Xiao, et al. Application of machine vision in oil and gas field inspection[J]. Automation panorama, 2020, 37(3): 87−89. [3] 魏浩楠. 基于深度学习SSD算法的目标检测研究[J]. 信息记录材料, 2024, 25(7): 166−168. WEI Haonan. Research on target detection based on deep learning SSD algorithm[J]. Information recording materials, 2024, 25(7): 166−168. [4] 邵延华, 张铎, 楚红雨, 等. 基于深度学习的YOLO目标检测综述[J]. 电子与信息学报, 2022, 44(10): 3697−3708. SHAO Yanhua, ZHANG Duo, CHU Hongyu, et al. A review of YOLO object detection based on deep learning[J]. Journal of electronics & information technology, 2022, 44(10): 3697−3708. [5] 程荣森. 基于YOLOv3算法的监控视频动态目标自动识别方法[J]. 自动化应用, 2025, 66(14): 21−23. doi: 10.19769/j.zdhy.2025.14.007 CHENG Rongsen. Automatic recognition method for dynamic targets in surveillance videos based on YOLOv3 algorithm[J]. Automation application, 2025, 66(14): 21−23. doi: 10.19769/j.zdhy.2025.14.007 [6] 车翔玖, 陈赫元. 基于改进YOLOv4的多目标光盘检测算法[J]. 吉林大学学报(工学版), 2022, 52(11): 2662−2668. doi: 10.13229/j.cnki.jdxbgxb20211013 CHE Xiangjiu, CHEN Heyuan. Muti-Object dishes detection algorithm based on improved YOLOv4[J]. Journal of Jilin University (engineering and technology edition), 2022, 52(11): 2662−2668. doi: 10.13229/j.cnki.jdxbgxb20211013 [7] CHEN Qiang, WANG Yingming, YANG Tang, et al. You only look one-level feature[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 01284. [8] 苗茹, 岳明, 周珂, 等. 基于改进YOLOv7的遥感图像小目标检测方法[J]. 计算机工程与应用, 2024, 60(10): 246−255. MIAO Ru, YUE Ming, ZHOU Ke, et al. Small target detection method in remote sensing images based on improved YOLOv7[J]. Computer engineering and applications, 2024, 60(10): 246−255. [9] 周飞, 郭杜杜, 王洋, 等. 基于改进YOLOv8的交通监控车辆检测算法[J]. 计算机工程与应用, 2024, 60(6): 110−120. ZHOU Fei, GUO Dudu, WANG Yang, et al. Vehicle detection algorithm based on improved YOLOv8 in traffic surveillance[J]. Computer engineering and applications, 2024, 60(6): 110−120. [10] KHANAM R, HUSSAIN M. YOLOv11: an overview of the key architectural enhancements[EB/OL]. (2024−10−23)[2025−08−29]. https://arxiv.org/abs/2410.17725. [11] LAW H, DENG Jia. CornerNet: detecting objects as paired keypoints[C]//Computer Vision–ECCV 2018. Cham: Springer, 2018: 765−781. [12] TIAN Zhi, SHEN Chunhua, CHEN Hao, et al. FCOS: a simple and strong anchor-free object detector[J]. IEEE transactions on pattern analysis and machine intelligence, 2022, 44(4): 1922−1933. doi: 10.1109/tpami.2020.3032166 [13] ZHU Xizhou, SU Weijie, LU Lewei, et al. Deformable DETR: deformable transformers for end-to-end object detection[EB/OL]. (2020−10−08)[2025−08−29]. https://arxiv.org/abs/2010.04159. [14] GIRSHICK R, DONAHUE J, DARRELL T, et al. Rich feature hierarchies for accurate object detection and semantic segmentation[C]//2014 IEEE Conference on Computer Vision and Pattern Recognition. Columbus: IEEE, 2014: 580−587. [15] GIRSHICK R. Fast R-CNN[C]//2015 IEEE International Conference on Computer Vision. Santiago: IEEE, 2015: 169. [16] 沙苗苗, 李宇, 李安. 改进Faster R-CNN的遥感图像多尺度飞机目标检测[J]. 遥感学报, 2022, 26(8): 1624−1635. SHA Miaomiao, LI Yu, LI An. Multiscale aircraft detection in optical remote sensing imagery based on advanced Faster R-CNN[J]. Journal of remote sensing, 2022, 26(8): 1624−1635. [17] CHEN Changlin, CHAO Xuewei. Conversion of infrared ocean target images to visible images driven by energy information[J]. Multimedia systems, 2023, 29(5): 2887−2898. doi: 10.1007/s00530-021-00879-2 [18] YUAN Jiaojiao, HU Yongli, SUN Yanfeng, et al. A plug-and-play image enhancement model for end-to-end object detection in low-light condition[J]. Multimedia systems, 2024, 30(1): 27. doi: 10.1007/s00530-023-01228-1 [19] 解宇敏, 张浪文, 余孝源, 等. 可见光−红外特征交互与融合的YOLOv5目标检测算法[J]. 控制理论与应用, 2024, 41(5): 914−922. doi: 10.7641/CTA.2023.20475 XIE Yumin, ZHANG Langwen, YU Xiaoyuan, et al. YOLOv5 object detection algorithm with visible-infrared feature interaction and fusion[J]. Control theory & applications, 2024, 41(5): 914−922. doi: 10.7641/CTA.2023.20475 [20] YUAN Maoxun, WANG Yinyan, WEI Xingxing. Translation, scale and rotation: cross-modal alignment meets RGB-infrared vehicle detection[C]//Computer Vision–ECCV 2022. Cham: Springer, 2022: 509−525. [21] ZHU Huayi, WU Heshan, WANG Xiaolong, et al. DPACFuse: dual-branch progressive learning for infrared and visible image fusion with complementary self-attention and convolution[J]. Sensors, 2023, 23(16): 7205. doi: 10.3390/s23167205 [22] HOU Zhiqiang, LI Xinyue, YANG Chen, et al. Dual-branch network object detection algorithm based on dual-modality fusion of visible and infrared images[J]. Multimedia systems, 2024, 30(6): 333. doi: 10.1007/s00530-024-01540-4 [23] LIU Jinyuan, FAN Xin, HUANG Zhanbo, et al. Target-aware dual adversarial learning and a multi-scenario multi-modality benchmark to fuse infrared and visible for object detection[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 5792−5801. [24] 严飞, 郑绪文, 孟川, 等. 基于FPGA的MobileNetV1目标检测加速器设计[J]. 现代电子技术, 2025, 48(1): 151−156. doi: 10.16652/j.issn.1004-373x.2025.01.025 YAN Fei, ZHENG Xuwen, MENG Chuan, et al. Design of MobileNetV1 object detection accelerator based on FPGA[J]. Modern electronics technique, 2025, 48(1): 151−156. doi: 10.16652/j.issn.1004-373x.2025.01.025 [25] 陈宗阳, 赵辉, 吕永胜, 等. 基于改进MobileNetV2网络的涂层表面缺陷识别方法[J]. 哈尔滨工程大学学报, 2022, 43(4): 572−579. CHEN Zongyang, ZHAO Hui, LÜ Yongsheng, et al. A recognition method of coating surface defects based on the improved MobileNetV2 network[J]. Journal of Harbin Engineering University, 2022, 43(4): 572−579. [26] 曹远杰, 高瑜翔. 基于GhostNet残差结构的轻量化饮料识别网络[J]. 计算机工程, 2022, 48(3): 310−314. CAO Yuanjie, GAO Yuxiang. Lightweight beverage recognition network based on GhostNet residual structure[J]. Computer engineering, 2022, 48(3): 310−314. [27] 杨国亮, 朱晨, 李放, 等. 基于改进MnasNet网络的低分辨率图像分类算法[J]. 传感器与微系统, 2021, 40(2): 142−145,153. doi: 10.13873/J.1000-9787(2021)02-0142-04 YANG Guoliang, ZHU Chen, LI Fang, et al. Classification algorithm of low-resolution images based on improved MnasNet[J]. Transducer and microsystem technologies, 2021, 40(2): 142−145,153. doi: 10.13873/J.1000-9787(2021)02-0142-04 [28] VASU P K A, GABRIEL J, ZHU J, et al. MobileOne: an improved one millisecond mobile backbone[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 7907−7917. [29] 崔金荣, 魏文钊, 赵敏. 基于改进MobileNetV3的水稻病害识别模型[J]. 农业机械学报, 2023, 54(11): 217−224,276. CUI Jinrong, WEI Wenzhao, ZHAO Min. Rice disease identification model based on improved MobileNetV3[J]. Transactions of the Chinese society for agricultural machinery, 2023, 54(11): 217−224,276. [30] QIN Danfeng, LEICHNER C, DELAKIS M, et al. MobileNetV4: universal models fortheMobile ecosystem[C]//Computer Vision–ECCV 2024. Cham: Springer, 2025: 78−96. [31] 包妮沙, 韩子松, 于嘉欣, 等. 基于改进Faster-RCNN的露天煤矿开采区遥感识别方法[J]. 东北大学学报(自然科学版), 2023, 44(12): 1759−1768. doi: 10.12068/j.issn.1005-3026.2023.12.012 BAO Nisha, HAN Zisong, YU Jiaxin, et al. Remote sensing identification method for open-pit coal mining area based on improved faster-RCNN[J]. Journal of Northeastern University (natural science edition), 2023, 44(12): 1759−1768. doi: 10.12068/j.issn.1005-3026.2023.12.012 [32] 王飞, 陈向俊. 基于Fast R-CNN和DeepLabV3+的变电站仪表盘示数自动识别方法[J]. 工程设计学报, 2024(6): 750−756. WANG Fei, CHEN Xiangjun. Automatic recognition method for substation meter panel readings based on Fast R-CNN and DeepLabV3+[J]. Chinese journal of engineering design, 2024(6): 750−756. [33] HASAN M. Vision Eagle Attention: a new lens for advancing image classification[EB/OL]. (2024−11−15)[2025−08−15]. https://arxiv.org/abs/2411.10564. [34] SHEN Sheng, YOUNES R. Reimagining linear probing: Kolmogorov-Arnold networks in transfer learning[EB/OL]. (2024−09−12)[2025−08−15]. https://arxiv.org/abs/2409.07763. [35] HE Kaiming, ZHANG Xiangyu, REN Shaoqing, et al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 770−778. [36] LIN T Y, GOYAL P, GIRSHICK R, et al. Focal loss for dense object detection[J]. IEEE transactions on pattern analysis and machine intelligence, 2020, 42(2): 318−327. doi: 10.1109/TPAMI.2018.2858826 [37] ZHANG Heng, FROMONT E, LEFEVRE S, et al. Multispectral fusion for object detection with cyclic fuse-and-refine blocks[C]//2020 IEEE International Conference on Image Processing. Abu Dhabi: IEEE, 2020: 276−280. [38] TANG Yuyao, JIANG Bo. The infrared- visible complementary recognition network based on context information[C]//2021 14th International Congress on Image and Signal Processing, BioMedical Engineering and Informatics. Shanghai: IEEE, 2021: 1−6. [39] ZHANG Heng, FROMONT E, LEFEVRE S, et al. Guided attentive feature fusion for multispectral pedestrian detection[C]//2021 IEEE Winter Conference on Applications of Computer Vision. Waikoloa: IEEE, 2021: 72−80. [40] ZHOU Hang, SUN Min, REN Xiang, et al. Visible-thermal image object detection via the combination of illumination conditions and temperature information[J]. Remote sensing, 2021, 13(18): 3656. doi: 10.3390/rs13183656 [41] XUE Yongjie, JU Zhiyong, LI Yuming, et al. MAF-YOLO: Multi-modal attention fusion based YOLO for pedestrian detection[J]. Infrared physics & technology, 2021, 118: 103906. doi: 10.1016/j.infrared.2021.103906 [42] ZHAO Wenqing, ZHAO Zhenhuan, XU Minfu, et al. Differential multimodal fusion algorithm for remote sensing object detection through multi-branch feature extraction[J]. Expert systems with applications, 2025, 265: 125826. doi: 10.1016/j.eswa.2024.125826 [43] WANG Zeyu, LI Shuaiting, HUANG Kejie. Cross-modal adaptation for object detection in infrared remote sensing imagery[J]. IEEE geoscience and remote sensing letters, 2025, 22: 7000805. doi: 10.1109/lgrs.2025.3527560 [44] ZHAO Ziyi, NIE Rencan. DAF-net: a dual attention fusion network with window-guided attention and invertible modules for infrared-visible image fusion[C]//2025 5th International Conference on Consumer Electronics and Computer Engineering. Dongguan: IEEE, 2025: 108−111.
下载: