面向火灾消防的视觉检测技术研究进展
胡浩1, 王欣2, 覃晓3, 梁新艳3     
1. 南宁市消防救援支队,广西南宁 530025;
2. 北京大兴国际机场,北京 102699;
3. 南宁师范大学, 广西人机交互与智能决策重点实验室,广西南宁 530001
摘要: 本文围绕火灾消防领域的视觉检测技术开展综述研究,从消防领域火灾检测主要公共数据集、基于传统机器学习和深度学习的火灾图像目标检测技术、跨模态特征融合的火灾检测技术以及面向火灾消防的视觉大语言模型4个方面,对相关技术原理、发展脉络及其优缺点进行系统梳理,并对典型火灾图像检测技术性能进行比较。最后,对火灾检测视觉技术的发展方向进行展望,针对当前存在的高质量数据集不足、微小火情检测难等问题,指出未来研究可重点关注混合检测模型构建、多源信息融合策略及大模型在消防场景中的应用,以支撑新一代智慧火灾消防体系的建设。
关键词: 图像处理    消防安全    火灾探测    目标检测    跨模态融合    深度学习    大模型    
Advances in Visual Detection Technologies for Firefighting
HU Hao1, WANG Xin2, QIN Xiao3, LIANG Xinyan3     
1. Nanning Fire and Rescue Division, Nanning, Guangxi, 530025, China;
2. Beijing Daxing International Airport, Beijing, 102699, China;
3. Guangxi Key Laboratory of Human-machine Interaction and Intelligent Decision, Nanning Normal University, Nanning, Guangxi, 530001, China
Abstract: A comprehensive review is conducted for the visual detection technologies for firefighting.The relevant technologies are reviewed in terms of the principles, developmental trajectories, and advantages and disadvantages from four key aspects: common datasets for fire detection, fire image object detection technologies based on conventional machine learning and deep learning, cross-modal fusion-based fire detection techniques, and vision-based large language models for firefighting.The performance of typical fire image detection technologies is compared.Finally, the future development directions of visual fire detection technologies are proposed.In view of the current challenges such as the scarcity of high-quality datasets and the difficulty in detecting incipient fires, it is suggested that the future research should focus on constructing hybrid detection models, developing multi-source information fusion strategies, and applying large models in firefighting scenarios to support the development of a new generation of intelligent firefighting systems.
Key words: image processing    fire safety    fire detection    object detection    cross-modal fusion    deep learning    large models    

火灾作为一种破坏性极强的灾害,对社会经济发展和人民生命财产安全构成了严重威胁[1]。及时、准确地探测火灾并发出预警,是有效控制火势、减少损失的关键环节。长期以来,消防安全体系主要依赖于感温、感烟等物理信号驱动的点式探测设备。然而,这类传统传感器存在响应延迟、在开放空间探测效率低下以及易受干扰源影响导致误报率高等固有缺陷,难以满足现代社会对高可靠性火灾预警的需求。因此,发展更快速、精确、智能的火灾探测技术已成为该领域亟待解决的难题。

随着智慧消防和物联网技术的兴起,运用图像处理与人工智能(Artifical Intelligence, AI)技术辅助火灾探测与应急响应成为新的研究热点。基于视觉的火灾探测技术将图像处理技术应用于消防安全领域,作为传统探测手段的补充与增强。该技术利用监控摄像头网络实现非接触式、大范围的实时监控,具备传统方法所不具备的快速、直观等特点[2-3]; 通过分析火灾的颜色、纹理、形状及动态特征,不仅能识别火情,还能提供火灾位置、规模和蔓延趋势等关键信息,为应急救援提供决策支持。该技术标志着消防安全正向智能化范式演进。

本文从消防领域火灾检测主要公共数据集、火灾图像目标检测技术、跨模态特征融合的火灾检测技术以及视觉大语言模型应用前景4个方面,分别阐述图像处理与AI技术应用于消防安全领域的研究进展,并对今后的研究趋势和方向进行展望。

1 消防领域火灾检测主要公共数据集

在AI驱动的消防安全领域,高质量、大规模的数据集是训练可靠算法模型的基石。不同任务(如火焰识别、烟雾检测等)需要融合多种传感器的特定类型数据以保证模型在复杂环境下的鲁棒性。当前消防领域火灾检测研究中主要的公共数据集通常以可见光(Red Green Blue, RGB)图像为主。Çelik等[4]发布的火灾与烟雾检测数据集(Fire and smoke detection dataset)包含数千张在不同光照条件下的室内外真实场景图像,是早期视觉火灾检测研究的基础。为提升模型的泛化能力,D-Fire数据集收集了超过2万张图像,包含大量森林、城市等复杂场景下的混淆性负样本(如雾、灯光),更适用于提升模型的鲁棒性与泛化能力[5]。随着研究焦点从“探测火”扩展到“保障人”,消防员个人防护装备(Personal Protective Equipment, PPE)检测数据集[6]提供了大量消防员PPE穿戴情况(如头盔、面罩、防护服等)的数据,用于相关消防员安全监测任务。2023年,Tiwari等[7]发布的Fire360数据集进一步扩展了数据模态,通过360度全景视频记录消防员在火场的真实作业行为,用于态势感知等高级认知任务。Foggia等[8]构建的Mivia火灾与烟雾检测数据集以真实室内外场景视频为主,并特意纳入强光照射、反光、移动的红色物体等高难度干扰场景,目前已成为检验火灾检测算法在复杂真实环境中可靠性的基准数据集。

跨模态技术的发展为火灾检测提供了新的研究方向。2023年,Hopkins等[9]发布FLAME 3数据集,首次同步提供可见光谱与辐射热成像图像,前者直观展示火灾的外观特征,后者则反映火灾的温度分布,两者结合有助于模型更准确地识别火灾,为跨模态火灾检测模型的研究提供了数据基础。

2 火灾图像目标检测技术 2.1 基于传统机器学习方法的火灾图像检测技术

基于传统机器学习方法的火灾图像检测技术主要依赖火焰和烟雾的物理特性构建启发式规则或统计模型,通过人工设计目标特征进行火情识别。

根据火灾防治经验,着火区域通常呈现红色光谱,因而颜色特征是火灾检测技术中最早使用的一类信息。早期研究者尝试在不同的颜色空间中建立规则以区分火焰与背景。例如,Horng等[10]提出一种基于颜色分析的实时火焰检测算法,该方法在RGB颜色空间中综合运用多条经验规则,包括红色(R)分量值大于绿色(G)分量值大于蓝色(B)分量值(即R>G>B),以及为红色分量值设定最低阈值,以实现火焰区域的精确判别与分割。然而,RGB模型对光照变化敏感,其在实际应用中性能不佳。为了克服这一缺陷,能够将亮度和色度信息解耦的颜色空间成为主流选择,其中YCbCr颜色空间因其出色的鲁棒性而备受青睐。Çelik等[4]利用YCbCr颜色空间中亮度(Y)分量与色度(Cb, Cr)分量之间的关系,提出一系列火灾检测规则,显著降低由光照变化引起的误判。

然而,仅以颜色特征判别着火区域易将红色灯光等物体误判为火焰,因此研究者引入了动态特征分析。Foggia等[8]利用背景差分技术提取视频序列中的运动区域,以捕捉火焰的动态特性,从而有效地将运动的火焰与静止的颜色相似干扰物(如红色的灯光或反光物体)区分。Yu等[11]和Mueller等[12]则针对火焰的非平滑动态纹理特性设计了专门的光流估计算法,以区别于普通物体的刚性运动。此外,火焰约10 Hz的闪烁频率也被视为一个关键的判别依据,可通过小波变换等时频分析工具捕捉这一动态线索,进一步滤除假阳性样本[13]。同时,局部二值模式(Local Binary Pattern, LBP)等[14]纹理算子也被用于补充描述火焰表面的纹理特征。

尽管传统方法在特定场景下取得了一定成功,但是人工设计的特征使其存在两类固有局限:其一,特征表达能力浅,传统方法提取的都是图像的底层物理特征,无法捕捉火灾场景中更深层次的语义信息;其二,泛化能力弱,传统方法高度依赖人工设定的阈值(如R>G>B)和“硬编码”规则,这些规则是在有限样本上总结出来的,缺乏对复杂多变环境的自适应能力。这些局限性严重制约了传统方法在消防实战场景中的应用。

2.2 基于深度学习的火灾图像检测技术 2.2.1 基于卷积神经网络的火灾检测技术

深度学习尤其是卷积神经网络(Convolutional Neural Network, CNN)的兴起,推动火灾图像检测从人工规则向数据驱动的范式转变。AlexNet的提出使得模型能够端到端学习高维特征,从根本上改善了传统方法依赖人工设计特征、泛化能力差的问题[15]。在此基础上,Ren等[16]提出的两阶段检测器Faster R-CNN通过“先提议后分类”的精细化流程解决了高精度检测的需求,但其速度较慢,难以满足实时预警的需求。

为解决实时监控目标检测的效率瓶颈,Redmon等[17]提出单阶段检测器YOLO(You Only Look Once)算法,将检测任务整合到单一网络中,极大地提升了推理速度,并迅速成为该领域的主流技术。李牧等[18]在YOLOv4的基础上提出改进算法YOLOv4-CC,该算法在主干网络输出的特征层后引入卷积注意力模块(Convolutional Block Attention Module, CBAM),并在主干网络与路径聚合网络中增加卷积层以提升特征提取能力,同时结合提出的智能火灾检测(Incipient Fire Detector, IFD)算法,实现对火灾的精准预测。2023年,Shao等[19]通过引入轻量化特征提取模块与注意力机制来提升YOLOv5在火灾场景下的小目标识别能力。Islam等[20]提出的Fire-YOLOv5针对多场景火焰与烟雾目标优化了YOLOv5网络,其在自建火灾图像数据集上取得了良好表现。Talaat等[21]采用无锚框(Anchor-free)机制和解耦式检测头(Decoupled head)等设计的YOLO-v8,不仅可简化检测流程,还能增强模型对不同尺度与形状目标的适应能力。梁煜等[22]设计了基于无描框和自适应注意力机制的算法,实现了精准实时检测多尺度火焰的目标。Zhou等[23]通过引入轻量化的Slim-Neck结构、GSConv卷积和通道剪枝技术,提出YOLOv8n-SMMP模型,实现了模型轻量化与对森林火灾的高精度检测。

CNN通过层级化的卷积操作展现出较强的局部特征提取能力。底层网络能自动学习边缘、颜色、纹理等基础特征,高层网络则能将这些基础特征组合成更复杂的结构乃至完整目标,这种分层表征能力明显优于传统人工方法。然而,CNN的局限性也同样源于卷积的局部性(Locality)和平移不变性(Translation invariance)。首先,卷积核的固定尺寸使得单个神经元只能感知局部区域,难以有效捕捉图像中的远距离依赖和全局上下文信息。在需要通过整体场景理解来区分真实火焰与火源色干扰物时,这种局限性易引发误判。其次,CNN的性能高度依赖大规模、高质量且精确标注的数据。在消防领域中,数据不平衡问题突出,非火灾场景图像数量远多于真实火灾场景图像,模型易偏向多数类,导致对少数类(火灾)的召回率较低。最后,标准CNN架构在处理小目标和遮挡目标时仍存在困难,而对需要在火灾萌芽阶段(火焰或烟雾区域极小)就发出预警的系统,这一问题尤为关键。

2.2.2 基于Transformer的火灾图像检测技术

近年来,在自然语言处理领域取得显著进展的Transformer架构,因其较强的全局特征建模能力而被引入视觉任务中,为缓解CNN在全局建模上的不足提供了新的思路[24]。Transformer的核心是自注意力(Self-attention)机制,该机制通过计算图像中不同位置特征之间的相关性权重,能够显式建模长距离依赖关系,从而增强对全局上下文的建模能力。

目前,Transformer已被应用于消防领域的火灾图像检测任务中。Mardani等[25]提出一种简化的Transformer编码器-解码器架构, 用于视频流中火焰的位置检测,并实时输出分类与定位结果。Makhija[26]提出基于Vision Transformer的FlameViT架构用于卫星影像中的野火检测,该架构通过视觉变换器检测烟雾,提供实时可靠的野火监测手段。Liu等[27]提出的TFNet通过引入上下文引导的注意力机制,实现了局部和全局特征的有效融合,在无人机视角下的小火点与稀疏烟雾的检测任务中表现出较好的检测精度。CN2VF-Net[28]也使用CNN提取多尺度局部特征,利用Transformer建模全局上下文关系并实现特征融合,从而兼顾局部特征提取效率与全局建模的能力。

基于Transformer的火灾图像检测方法在消防视觉任务中展现出巨大潜力,它解决了CNN的局部归纳偏置问题,能够较好地建立全局依赖模型,这使其在理解复杂场景、消除歧义方面具有天然优势。然而,自注意力机制的计算复杂度会随输入图像尺寸的增大而提升,这导致其在处理高分辨率图像时计算开销巨大,对硬件资源要求高;同时,由于缺乏CNN的局部性和平移不变性等先验知识,Transformer通常需要更大规模的数据集进行训练才能获得稳定性能,而消防领域的高质量标注数据相对稀缺,这些都在一定程度上限制了Transformer在消防火灾检测领域的进一步应用。

2.3 火灾图像检测模型性能对比分析(基于Mivia数据集)

为更清晰地观察火灾图像检测技术的效果,表 1列出了不同算法在Mivia数据集上的性能。Mivia数据集包含丰富的室内外真实火灾场景,并引入灯光、移动物体等强干扰项,已被广泛用于评估火灾检测算法在复杂环境下的性能。表 1揭示了火灾图像检测技术从依赖人工特征的传统方法,逐步向数据驱动的深度学习模型发展,并进一步形成融合多种机制的混合架构的演进脉络。

表 1 火灾检测模型在Mivia数据集上的性能对比 Table 1 Performance comparison of fire detection models on the mivia dataset
算法
Algorithm
年份
Year
核心技术/范式
Core technology/paradigm
准确率/%
Accuracy/%
误报率/%
False positive rate/%
漏报率/%
False negative rate/%
Conventional methods YUV-SIFT fusion multi-expert fire detection[29] 2014 Video analysis technology combination 92.86 13.33 0.00
Mivia multi-feature fusion algorithm[8] 2015 Fusion of color, shape and motion features 93.55 11.67 0.00
CNN-based methods Efficient deep CNN-based fire detection and localization [30] 2018 Optimized CNN structure 94.39 9.07 2.13
Deep Normalization[31] 2019 Normalized convolutional layer 94.50 8.87 2.12
UFS-Net[32] 2022 Unified flame and smoke detection CNN 96.95 2.57
Hybrid/advanced methods TCF-Net[33] 2024 CNN+Transformer hybrid architecture 97.80 2.49
Adaptive attention multi-scale fire detection[22] 2024 Anchor-Free, adaptive attention 95.96 2.37

首先是从传统方法到深度学习的范式飞跃,传统方法依赖人工设计的浅层特征(如颜色、形状),虽然在特定条件下表现尚可,但泛化能力弱,在复杂场景下误报率高。例如,基于传统方法的多专家系统火灾图像检测方法误报率高达11.67%[8]。相比之下,CNN的方法通过数据驱动方式自动学习图像特征,围绕模型架构、训练策略和部署效率等方面进行优化,在图像识别任务中性能显著提升。基于优化CNN结构的高效深度CNN模型使用较小的卷积核,并且不包含密集的全连接层,将计算需求降至最低的同时,保障检测的准确性,能将误报率降至9.07%,同时准确率达到94.39%[30]。其次是从通用CNN到混合架构的深度优化。随着深度学习技术的发展,火灾图像检测技术的研究重点逐渐转向更精细化的模型设计。例如,Hosseini等[32]提出的UFS-Net通过构建统一的火焰与烟雾检测框架,将误报率压缩至2.57%。当前,研究前沿体现在融合了CNN与Transformer的TCF-Net和采用自适应注意力机制的算法等混合架构上,一方面CNN擅长捕捉局部纹理、边缘等细粒度特征,另一方面Transformer具备全局上下文依赖建模能力,二者融合兼顾了局部细节与全局关联,同时自适应注意力机制能针对性聚焦关键区域,有效降低极端条件下的误报风险,在保持95%以上高准确率的同时,实现2.5%以下的极低误报率,达到性能的最佳平衡。

综上,消防领域火灾检测技术已从早期依赖特征工程的方法,发展到以深度学习为核心,并逐步向多机制融合的方向演进。这些研究不仅为后续工作提供了可靠的性能基准,也为开发更高效、更鲁棒的火灾图像检测技术指明了具体的技术方向。

3 跨模态特征融合的火灾检测技术 3.1 传统跨模态特征融合方法:从多尺度分解到早期融合

在深度学习成为主流之前,火灾检测跨模态图像特征融合主要依赖传统信号处理技术,通过融合烟雾、温度、红外及气体等多源传感器数据来提高火灾探测的准确率并降低误报率[34]。Foggia等[8]提出了一种多专家融合框架,该框架并行利用多个专家分别对火焰的颜色、形状变化以及运动模式进行分析,最后综合所有专家的意见进行决策,从而有效区分真实火焰与干扰物,提升了检测鲁棒性。付迎春等[35]基于中分辨率成像光谱仪(Moderate-resolution Imaging Spectroradiometer, MODIS)遥感影像,通过计算归一化燃烧比(Normalized Difference Burn Ratio, NDBR)指数与B样条拟合的方法,实现了对森林大范围的火灾过火区域的检测与参数提取,为大尺度火情评估与管理提供了技术支撑。

尽管这些传统方法具有算法结构直观和计算复杂度较低的优势,但是其致命弱点在于融合规则的“静态”和“浅层”。具体来说,传统方法的融合策略大多依赖人工设计,缺乏根据图像内容自适应调整的能力。此外,其特征提取通常在像素或变换域系数层面进行,难以处理复杂场景,并会引入伪影或导致信息丢失。这些局限性,极大地推动了火灾视觉检测技术向基于深度学习的新型融合范式转型。

3.2 基于深度学习的跨模态特征融合方法

深度学习技术凭借端到端特征学习和非线性映射能力推动了图像融合方法从依赖人工规则到数据驱动范式的转变。Transformer的全局建模能力使其在跨模态图像特征融合任务中被广泛应用,Wang等[36]采用Swin Transformer作为骨干网络,通过层级化结构和滑窗操作,在图像内部和不同源图像之间进行特征交互。DATFuse[37]利用双注意力Transformer实现更精细的信息筛选与融合,使模型能更精确地聚焦于源图像中的显著区域并保留互补背景信息。在消防领域常见的可见光与红外图像融合中,Fang等[38]提出一种跨模态融合Transformer(Cross-modality Fusion Transformer, CFT),将CNN提取的局部纹理特征与Transformer提取的全局依赖相结合,在复杂背景和小目标场景下提升了检测性能。这些方法既保留了可见光纹理细节,又凸显了红外热目标,为后续的检测任务提供了更丰富的信息。Zhang等[39]提出的MFT通过并行的CNN与Transformer分支处理局部和全局信息,并引入跨模态特征交互模块来增强两种特征的互补性。Rui等[40]针对野外火灾识别任务,提出一种自适应学习模态特定特征及共享特征的框架。Xu等[41]提出一种目标感知融合网络MCDet,引入内容引导注意力网络,通过动态门控机制聚合多维特征,以应对植被遮挡和光照干扰等复杂场景。

除了直接的特征融合,研究人员还探索了生成式方法。Jin等[42]通过在生成对抗网络中引入多分类和多层次约束,实现红外热目标与可见光纹理细节的有效保留。Bhamra等[43]提出一种用于多模态野外火灾烟雾检测的SmokeyNet,该方法融合卫星数据、气象传感器数据和光学图像,利用CNN、长短期记忆(Long Short-Term Memory, LSTM)网络和视觉变换器提取时空特征,从而实现高效烟雾检测。此外,一些研究将融合模态扩展至非图像数据。Wang等[44]通过融合烟雾、温度、一氧化碳以及火焰传感器等数据,利用D-S证据理论(Dempster-Shafer evidence theory)进行决策,实现了对火灾状态的精准、快速研判,有效克服了单一传感器在复杂室内环境下易受干扰而产生误报的缺陷。Ge等[45]通过构建时空知识图谱,融合多源异构的森林火灾数据,用于特征提取和火险预测。

总体而言,基于跨模态特征融合的火灾图像检测技术通过架构层面的优势互补和数据层面的信息互补,能够构建出更加接近人类决策模式的、鲁棒的探测系统,尤其是引入气体、气象、地形等非图像数据后,模型能够从更本质的物理和环境层面去理解和预测火灾风险。然而,该类方法在模型复杂度、计算成本以及多源数据获取与时空对齐等方面仍面临挑战,这在一定程度上制约了其在实际消防场景中的大规模应用。

4 面向火灾消防的视觉大语言模型

视觉语言模型(Vision Language Model, VLM)将大语言模型(Large Language Model, LLM)的语言能力与计算机视觉的图像理解能力相结合,为面向火灾灾后评估等视觉密集型任务提供全新范式。Chen等[46]面向区域火灾后图像分析任务,探索了将视觉大语言模型与人工指令相结合的方法,实现了灾后图像的检测分析,并生成包含损毁等级、空间坐标和图像证据的灾后损毁评估报告。Zahabnazouri等[47]针对火灾后不同时期的多光谱卫星影像,结合图像检测技术和遥感指数计算,如差值归一化火烧指数(difference Normalized Burn Ratio, dNBR)和差值归一化植被指数(difference Normalized Difference Vegetation Index, dNDVI),对灾后的燃烧严重程度和植被恢复情况进行分析。上述研究展现了将视觉检测与遥感计算相结合的潜力,为LLM以及VLM在火灾消防领域的应用提供了有益启示。

5 展望

火灾消防领域的图像检测技术,已经从早期依赖颜色、运动等人工设计特征的传统机器学习方法,逐步发展为以数据驱动的深度学习模型为主的技术体系。为突破单一可见光传感器在浓烟、夜间等复杂环境下的感知局限,相关研究进一步引入了以可见光与红外热成像为代表的跨模态融合技术。同时,LLM和VLM的出现,更使得火灾检测的图像处理技术正在从单一的“感知”向更高级的“认知”(理解情境、辅助决策、生成报告)演进[48]

尽管相关技术发展迅速,但当前研究仍面临若干挑战。首先,高质量、大规模且场景多样化的公共数据集仍然匮乏,制约了模型的泛化能力与可靠性。其次,如何在复杂背景干扰下进一步降低误报率并高效检测处于萌芽阶段的微小火灾目标,仍是亟待攻克的技术难题。未来研究可围绕构建高效、鲁棒的混合检测模型,深化多源异构信息的智能融合策略,并探索大模型在消防场景下的合理应用方式,以逐步推进新一代智慧消防体系的实际落地,为保障人民生命财产安全提供技术支撑。

参考文献
[1]
SULTHANA S F, WISE C T A, RAVIKUMAR C V, et al. Review study on recent developments in fire sensing methods[J]. IEEE Access, 2023, 11: 90269-90282. DOI:10.1109/ACCESS.2023.3306812
[2]
MUHAMMAD K, AHMAD J, BAIK S W. Early fire detection using convolutional neural networks during surveillance for effective disaster management[J]. Neurocomputing, 2018, 288: 30-42. DOI:10.1016/j.neucom.2017.04.083
[3]
SHANKAR G, GEETHA M K. Comprehensive survey on fire detection with machine learning and deep learning models[C]//Computer Networks and Inventive Communication Technologies: Proceedings of Fifth ICCNCT. Singapore: Springer, 2022: 389-408.
[4]
ÇELIK T, DEMIREL H. Fire detection in video sequen- ces using a generic color model[J]. Fire Safety Journal, 2009, 44(2): 147-158.
[5]
LI C X, DU Y, ZHANG X, et al. YOLOGX: an improved forest fire detection algorithm based on YOLOv8[J]. Frontiers in Environmental Science, 2025, 12: 1486212. DOI:10.3389/fenvs.2024.1486212
[6]
BARLYBAYEV A, AMANGELDY N, KURMETBEK B, et al. Personal protective equipment detection using YOLOv8 architecture on object detection benchmark datasets: a comparative study[J]. Cogent Engineering, 2024, 11(1): 2333209. DOI:10.1080/23311916.2024.2333209
[7]
TIWARI A, MASOUD F, NGUYEN D T, et al. Fire 360: a benchmark for robust perception and episodic memory in degraded 360-degree firefighting videos[EB/OL]. (2025-01-02)[2025-06-15]. https://arxiv.org/abs/2506.02167.
[8]
FOGGIA P, SAGGESE A, VENTO M. Real-time fire detection for video-surveillance applications using a combination of experts based on color, shape, and motion[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2015, 25(9): 1545-1556. DOI:10.1109/TCSVT.2015.2392531
[9]
HOPKINS B, ONEILL L, MARINACCIO M, et al. FLAME 3 dataset: unleashing the power of radiometric thermal UAV imagery for wildfire management[EB/OL]. (2024-12-03)[2025-06-15]. https://arxiv.org/abs/2412.02831.
[10]
HORNG W B, PENG J W, CHEN C Y. A new image-based real-time flame detection method using color analysis[C]//Proceedings of 2005 IEEE Networking, Sensing and Control. Piscataway: IEEE, 2005: 100-105.
[11]
YU C Y, FANG J, WANG J J, et al. Video fire smoke detection using motion and color features[J]. Fire Technology, 2010, 46(3): 651-63. DOI:10.1007/s10694-009-0110-z
[12]
MUELLER M, KARASEV P, KOLESOV I, et al. Optical flow estimation for flame detection in videos[J]. IEEE Transactions on Image Processing, 2013, 22(7): 2786-2797. DOI:10.1109/TIP.2013.2258353
[13]
TÖREYIN B U, CINBIS R G, DEDEOGLU Y, et al. Fire detection in infrared video using wavelet analysis[J]. Optical Engineering, 2007, 46(6): 067204. DOI:10.1117/1.2748752
[14]
MAKSYMIV O, RAK T, PELESHKO D. Video-based flame detection using LBP-based descriptor: influences of classifiers variety on detection efficiency[J]. International Journal of Intelligent Systems and Applications, 2017, 9(2): 42-48. DOI:10.5815/ijisa.2017.02.06
[15]
KRIZHEVSKY A, SUTSKEVER I, HINTON G E. ImageNet classification with deep convolutional neural networks[J]. Communications of the ACM, 2017, 60(6): 84-90. DOI:10.1145/3065386
[16]
REN S P, HE K M, GIRSHICK R, et al. Faster RCN- N: towards real-time object detection with region proposal networks[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017, 39(6): 1137-1149. DOI:10.1109/TPAMI.2016.2577031
[17]
REDMON J, DIVVALA S, GIRSHICK R, et al. You Only Look Once: unified, real-time object detection[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE, 2016: 779-788.
[18]
李牧, 何允帅, 卢金波, 等. 基于深度学习的早期火灾预警算法[J]. 计算机系统应用, 2022, 31(11): 230-237.
[19]
SHAO Z L, LU S Y, SHI X X, et al. Fire detection methods based on an optimized YOLOv5 algorithm[J]. Emergency Management Science and Technology, 2023, 3: 1.
[20]
ISLAM A, HABIB M I. Fire detection from image and video using YOLOv5[EB/OL]. (2023-10-10)[2025-06-15]. https://arxiv.org/abs/2310.06351.
[21]
TALAAT F M, ZAINELDIN H. An improved fire detection approach based on YOLO-v8 for smart cities[J]. Neural Computing and Applications, 2023, 35(28): 20939-20954. DOI:10.1007/s00521-023-08809-1
[22]
梁煜, 陈童, 张为. 融合自适应注意力的多尺度火灾检测算法[J]. 北京理工大学学报, 2024, 44(1): 91-101.
[23]
ZHOU N Z, GAO D M, ZHU Z L. YOLOv8n-SMMP: a lightweight YOLO forest fire detection model[J]. Fire, 2025, 8(5): 183. DOI:10.3390/fire8050183
[24]
DOSOVITSKIY A, BEYER L, KOLESNIKOV A, et al. An image is worth 16×16 words: transformers for image recognition at scale[EB/OL]. (2021-01-03)[2025-06-15]. https://arxiv.org/abs/2010.11929.
[25]
MARDANI K, VRETOS N, DARAS P. Transformer-based fire detection in videos[J]. Sensors, 2023, 23(6): 3035. DOI:10.3390/s23063035
[26]
MAKHIJA A. FlameViT: wildfire detection through vision transformers for enhanced satellite imagery analysis[C]//2024 First International Conference on Data, Computation and Communication. Piscataway: IEEE, 2025: 640-647.
[27]
LIU H Y, ZHANG F Q, XU Y Q, et al. TFNet: transformer-based multi-scale feature fusion forest fire image detection network[J]. Fire, 2025, 8(2): 59. DOI:10.3390/fire8020059
[28]
AHMAD N, AKBAR M, ALKHAMMASH E H, et al. CN2VF-Net: a hybrid convolutional neural network and vision transformer framework for multi-scale fire detection in complex environments[J]. Fire, 2025, 8(6): 211. DOI:10.3390/fire8060211
[29]
DI LASCIO R, GRECO A, SAGGESE A, et al. Improving fire detection reliability by a combination of video analytics[C]//Image Analysis and Recognition. Cham: Springer, 2014: 477-484.
[30]
MUHAMMAD K, AHMAD J, LV Z, et al. Efficient deep CNN-based fire detection and localization in video surveillance applications[J]. IEEE Transactions on Systems, Man, and Cybernetics: Systems, 2019, 49(7): 1419-1434. DOI:10.1109/TSMC.2018.2830099
[31]
HASHEMZADEH M, ZADEMEHDI A. Fire detection for video surveillance applications using ICA K-medoids-based color model and efficient spatio-temporal visual features[J]. Expert Systems with Applications, 2019, 130: 60-78. DOI:10.1016/j.eswa.2019.04.019
[32]
HOSSEINI A, HASHEMZADEH M, FARAJZADEH N. UFS-Net: a unified flame and smoke detection method for early detection of fire in video surveillance applications using CNNs[J]. Journal of Computational Science, 2022, 61: 101638. DOI:10.1016/j.jocs.2022.101638
[33]
付燕, 杨旭, 叶鸥. 基于CNN和Transformer特征融合的烟雾识别方法[J]. 计算机工程与科学, 2024, 46(11): 2045-2052.
[34]
DENG X W, SHI X W, WANG H S, et al. An indoor fire detection method based on multi-sensor fusion and a lightweight convolutional neural network[J]. Sensors, 2023, 23(24): 9689. DOI:10.3390/s23249689
[35]
付迎春, 袁修孝, 宋妍, 等. 基于MODIS影像的森林火灾火线检测方法[J]. 遥感学报, 2009, 13(3): 535-548.
[36]
WANG Z S, CHEN Y L, SHAO W Y, et al. SwinFuse: a residual swin transformer fusion network for infrared and visible images[J]. IEEE Transactions on Instrumentation and Measurement, 2022, 71: 5016412.
[37]
TANG W, HE F Z, LIU Y, et al. DATFuse: infrared and visible image fusion via dual attention transformer[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2023, 33(7): 3159-3172. DOI:10.1109/TCSVT.2023.3234340
[38]
FANG Q Y, HAN D P, WANG Z K. Cross-modality fusion transformer for multispectral object detection[EB/OL]. (2022-10-04)[2025-06-15]. https://arxiv.org/abs/2111.00273.
[39]
ZHANG C M, YUAN C B, LUO Y, et al. MFT: multi-scale fusion transformer for infrared and visible image fusion[C]//Artificial Neural Networks and Machine Learning: ICANN 2023. Cham: Springer, 2023: 485-496.
[40]
RUI X, LI Z Q, ZHANG X Y, et al. A RGB-Thermal based adaptive modality learning network for day-night wildfire identification[J]. International Journal of Applied Earth Observation and Geoinformation, 2023, 125: 103554. DOI:10.1016/j.jag.2023.103554
[41]
XU Y Z, HE W, BI Y, et al. MCDet: target-aware fusion for RGB-T fire detection[J]. Forests, 2025, 16(7): 1088. DOI:10.3390/f16071088
[42]
JIN Q, TAN S Q, ZHANG G, et al. Visible and infrared image fusion of forest fire scenes based on generative adversarial networks with multi-classification and multi-level constraints[J]. Forests, 2023, 14(10): 1952. DOI:10.3390/f14101952
[43]
BHAMRA J K, ANANTHA RAMAPRASAD S, BALDOTA S, et al. Multimodal wildland fire smoke detection[J]. Remote Sensing, 2023, 15(11): 2790. DOI:10.3390/rs15112790
[44]
WANG Q J, LIN J Y, ZHOU Y, et al. Indoor fire detection system based on multi-sensor information fusion algorithm[C]//2023 IEEE 4th International Conference on Pattern Recognition and Machine Learning. Piscataway: IEEE, 2023: 637-641.
[45]
GE X T, YANG Y, PENG L, et al. Spatio-temporal knowledge graph based forest fire prediction with multi source heterogeneous data[J]. Remote Sensing, 2022, 14(14): 3496. DOI:10.3390/rs14143496
[46]
CHEN Z H, SHAMSABADI E A, JIANG S, et al. Integration of large vision language models for efficient post-disaster damage assessment and reporting[EB/OL]. (2024-11-03)[2025-06-15]. https://arxiv.org/abs/2411.01511.
[47]
ZAHABNAZOURI S, BELMONT P, DAVID S, et al. Detecting burn severity and vegetation recovery after fire using dNBR and dNDVI indices: insight from the Bosco difesa grande, gravina in southern Italy[J]. Sensors, 2025, 25(10): 3097. DOI:10.3390/s25103097
[48]
CHEN S Y, LUO G F, CHEN L B. Intelligent urban emergency response: integrating large language models, multi-objective optimization, and reinforcement learning[C]//2024 IEEE Smart World Congress. Piscataway: IEEE, 2025: 1469-1476.