基于双域自适应融合与特征细化的古汉字图像补全
邸梦1, 万金2,3     
1. 咸阳师范学院于右任书法学院,陕西咸阳 712099;
2. 齐鲁工业大学(山东省科学院),山东省计算中心(国家超级计算济南中心),算力互联网与信息安全教育部重点实验室,山东济南 250353;
3. 山东省算力互联网与服务计算重点实验室,山东省基础科学研究中心(计算机科学),山东济南 250353
摘要: 目前针对古汉字图像补全鲜有研究,直接使用通用图像补全技术会导致古汉字字体结构失真、笔画模糊等问题,难以满足古汉字在可读性和易用性方面的需求。针对以上问题,本文构建古汉字图像补全数据集HanInpaint并提出一种基于双域自适应融合与特征细化的古汉字图像补全方法。具体来说,HanInpaint数据集包括1 386张训练图像和347张测试图像,涵盖楷书、篆书、草书等多种字体风格,为古汉字图像补全提供标准化数据与评价基准。在提出的基于双域自适应融合与特征细化的古汉字图像补全方法中,双域特征融合模块(Dual-Domain Feature Fusion Module,DDFFM)通过联合空域与频域信息实现跨域特征自适应融合,以增强模型对古汉字结构信息的建模能力;多尺度特征细化模块(Multi-Scale Feature Refinement Module,MSFRM)通过对不同尺度下的局部与全局特征进行细化以提升补全图像细节保真度;高频感知损失(High-Frequency-Aware Loss, HFALoss)约束了补全图像与真实图像在高频上的差异,从而提升笔画等高频细节的复原质量。在HanInpaint数据集上的实验结果表明,本文所提方法在测试集上的平均绝对误差(Mean Absolute Error,MAE)为0.03,峰值信噪比(Peak Signal-to-Noise Ratio,PSNR)为31.56 dB,结构相似性(Structural Similarity Index Measure,SSIM)为0.973 1,学习感知图像块相似度(Learned Perceptual Image Patch similarity,LPIPS)为0.11,Fréchet初始距离(Fréchet Inception Distance,FID)为19.63,验证了所提方法的有效性和可行性。
关键词: 古汉字图像补全    数据集    双域特征融合模块    多尺度特征细化模块    高频感知损失    
Ancient Chinese Character Image Inpainting via Dual-Domain Adaptive Fusion and Feature Refinement
DI Meng1, WAN Jin2,3     
1. School of Yu Youren Calligraphy, Xianyang Normal University, Xianyang, Shaanxi, 712099, China;
2. Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences), Jinan, Shandong, 250353, China;
3. Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science, Jinan, Shandong, 250353, China
Abstract: Currently, there are few studies on ancient Chinese character image inpainting.The direct use of general image inpainting techniques can lead to distortion of the font structure and blurring of strokes of ancient Chinese characters, which fails to meet the readability and usability requirements of ancient Chinese characters.To address the above issues, this paper constructs an ancient Chinese character inpainting dataset termed HanInpaint, and proposes an ancient Chinese character image inpainting via dual-domain adaptive fusion and feature refinement.Specifically, the HanInpaint dataset contains 1 386 training images and 347 testing images, covering various font styles such as regular script, seal script, and cursive script, providing standardized data and evaluation benchmark for ancient Chinese character image inpainting.In the proposed ancient Chinese character image inpainting method based on dual-domain adaptive fusion and feature refinement, a Dual-Domain Feature Fusion Module (ODFFM) is designed to achieve cross-domain feature adaptive fusion by combining spatial and frequency domain information, thereby enhancing the model′s ability to model the structural information of ancient Chinese characters.Secondly, a Multi-Scale Feature Refinement Module (MSFRM) is proposed to improve the detail fidelity of the inpainting images by refining local and global features on different scales.Finally, a High-Frequency-Aware Loss (HFALoss) is introduced to constrain the difference between the inpainting image and the real image in high frequencies, thus improving the restoration quality of high-frequency details such as stroke details.The quantitative results on the HanInpaint dataset demonstrate the effectiveness and feasibility of the proposed method, with the Mean Absolute Error (MAE) of 0.03, Peak Signal-to-Noise Ratio (PSNR) of 31.56 dB, Structural Similarity Index Measure (SSIM) of 0.973 1, Learned Perceptual Image Patch Similarity (LPIPS) of 0.11, and Fréchet Inception Distance (FID) of 19.63.
Key words: ancient Chinese character image inpainting    dataset    dual-domain feature fusion module    multi-scale feature refinement module    high-frequency-aware loss    

古汉字承载着丰富的历史文化信息,是人类文明的重要载体,对语言演变、文化传承及考古研究具有重要意义。然而,受自然风化、氧化腐蚀、历史战乱及人为破坏等因素影响,古汉字文献和碑刻常出现不同程度的缺失与损坏,给笔法与章法的解读与传承带来阻碍。随着计算机技术的发展,古汉字图像补全已成为一种可行的解决方案,也是计算机视觉领域中一项有意义的任务。

古汉字图像补全模型需要以真实古文字图像作为训练数据,但目前尚缺乏面向古汉字图像补全的公开数据集。现有汉字数据集主要侧重于手写体[1-3]和风格化字体[4],前者通常使用特定的手写体数据集[5-6],后者通常使用标准化字体(如TrueType字体)生成。然而,这些数据集与真实古汉字数据集存在显著差异,导致直接应用于古汉字补全时性能不佳。

随着深度学习技术的快速发展,面向自然和人脸图像的通用图像补全技术取得了显著进展,并在监控[7]、摄影[8]等领域得到广泛应用。基于卷积神经网络(Convolutional Neural Network,CNN)的图像补全方法能够有效捕获图像的深层语义特征[9-10],从而提升补全结果的语义一致性。Liu等[11]在单阶段网络的特征层中同时建模颜色与内容信息,以保证生成结果的整体一致性。Yu等[12]提出一种即插即用的区域归一化模块,利用图像内容缺失掩码对缺失和未缺失区域的像素进行归一化,从而解决均值和方差漂移问题并有效缓解掩码边界处的特征分布差异。Zhao等[13]利用调制方法动态调整生成器的特征分布,提升模型对不规则掩码的适应性。随着生成模型的演进,基于扩散理论的图像补全方法在保持语义连贯性方面展现出新的优势。Zhu等[14]提出全局结构引导的扩散模型,确保生成结果与原场景的结构一致性。Liu等[15]设计一种残差去噪扩散模型,通过显式去除残差噪声来保留更多图像内容,从而获得更加清晰的生成结果。Ju等[16]通过双分支扩散架构分别建模局部与全局结构,以提升复杂场景下的补全性能。

然而,尽管通用图像补全方法在自然图像中能够利用学习的特征信息对缺损区域进行内容填充,但在纹理细节的精确重构方面仍存在不足[17]。由于古汉字兼具严苛的笔画拓扑约束(笔顺、交叉、节点)与独特的空间排布规则(左右、上下、包围等构形),这使得古汉字补全更具挑战性。此外,书体差异进一步增加古汉字补全任务的复杂度(图 1),如草书需要维系一气呵成的笔势,篆书则要求对称均衡与圆转接笔,其结构信息密度远超自然图像。因此,直接将通用图像补全方法应用于古汉字图像补全时,修复结果常常存在字体结构失真(如篆书对称结构破坏)、笔画衔接不自然(如草书笔势不连贯)以及纹理恢复不准确(如篆书的墨色变化缺失)等问题。

图 1 古汉字图像补全数据集HanInpaint中破损图像及其原始图像 Fig. 1 Some corrupted images and original images in the proposed ancient Chinese character image inpainting dataset HanInpaint

针对上述问题,本文首次构建一个古汉字图像补全数据集HanInpaint用于训练和评估真实古汉字图像补全模型,并已开源在https://github.com/jinwan1994/HanInpaint-Dataset。如图 1所示,HanInpaint数据集涵盖楷书、篆书、草书等多种字体风格,并通过随机掩码生成多种缺失模式(如随机缺损、局部遮挡、条状残缺等)来模拟真实破损与残缺情况。

针对现有通用图像补全方法在古汉字图像补全过程中存在结构理解不足、细节还原能力弱的问题,本文提出一种基于双域自适应融合与特征细化的古汉字图像补全方法。该方法利用双域特征融合模块(Dual-Domain Feature Fusion Module,DDFFM)结合空域和频域特征,有效增强模型对古汉字字体结构信息的建模能力;利用多尺度特征细化模块(Multi-Scale Feature Refinement Module,MSFRM)加强不同尺度下的局部与全局特征的交互;并利用高频感知损失(High-Frequency-Aware Loss, HFALoss)进一步优化古汉字笔画边缘细节的修复质量。

1 相关工作 1.1 基于深度学习的图像补全方法

随着深度学习技术的发展,基于深度学习的图像补全方法[18-19]取得了显著进展,这些方法利用深度神经网络从大规模数据中学习到的图像高层语义特征来生成高质量的补全结果。Zeng等[18]提出基于生成对抗网络(Generative Adversarial Networks,GAN)的上下文聚合网络AOT-GAN,它通过增强上下文推理和纹理合成能力来完善补全结果。为解决图像补全算法在深层特征建模方面的不足,Jain等[19]提出利用一个快速傅立叶合成(Fast Fourier Synthesis,FFS)模块,将大掩码补全(Large Mask Inpainting,LaMa)[20]的思想和快速傅立叶卷积残差块结合,并嵌入到一个基于StyleGAN2[21]的由粗到精生成器中,以增强细节恢复能力。Quan等[22]提出一个三阶段修复网络,采用多感受野特征联合学习的方法以提升补全质量。近年来,扩散模型作为一种基于概率的生成模型,通过逐步加噪与去噪过程,实现了高质量的图像生成和补全。Ju等[16]提出双分支扩散架构的即插即用模块BrushNet,显著提高了补全图像的质量。然而在面对复杂结构纹理信息时,受限于网络的边缘纹理建模能力,该方法仍易出现结构不一致的问题[23]

同时,古汉字识别研究也已取得显著进展,涂超虎等[24]提出自适应多级特征融合的场景古汉字识别方法,能够在复杂场景下有效建模多层次特征以提升识别精度。胡根生等[25]提出一种基于混合核加权最小二乘支持向量回归(Weighted Least Squares Support Vector Regression,WLS-SVR)方法,增强了传统机器学习在古汉字识别中的应用能力。然而,古汉字图像残缺与破损等问题会严重破坏特征提取的有效性,从而导致识别准确率显著下降。此外,由于古汉字结构复杂,直接将通用图像补全方法应用于古汉字图像时,往往难以生成合理的修复结果[17]

1.2 频域特征在神经网络中的应用

频域特征能够有效表征图像的结构信息和纹理特征,因此被广泛应用于图像超分辨率重建以及去噪等低级视觉任务。傅里叶变换(Fourier Transform,FT)[26]是常用的频域分析工具,它将空间域信息转换为频域表示。近年来,许多研究尝试在深度学习框架中融入频域特征。Fritsche等[27]通过学习性高频恢复来提高超分辨率生成图像的细节保真度。离散小波变换(Discrete Wavelet Transform,DWT)[28]也被广泛应用于提取高频特征以增强生成区域的清晰度。Zhang等[29]在超分辨率任务中采用DWT提取频域信息,并结合CNN进行高分辨率重建,在处理含有文字的图像时表现出优越的性能。

与上述方法不同,本文方法针对现有图像补全方法在古汉字图像补全过程中存在的结构理解不足和细节还原能力弱的问题,提出一种基于双域自适应融合与特征细化的古汉字图像补全方法,该方法结合空域和频域特征,实现跨域特征自适应融合,可有效增强模型对古汉字字体结构信息的建模能力,并提升笔画细节等高频信息的修复质量。

2 方法 2.1 模型概述

本文模型结构如图 2所示。输入为损坏的古汉字图像$ I \in \mathbb{R}^{H \times W \times 3}$和对应的掩码图像$ I_m \in \mathbb{R}^{H \times W \times 1}$,其中HW、3分别为图像的高度、宽度和通道数。在特征提取阶段,输入图像IIm首先通过DDFFM进行特征提取,利用编码器提取空域特征FI。同时,高频特征提取模块(High-Frequency Feature Extraction Module,HFFEM)通过DWT将图像IIm分解为4个频域分量,分别是HHHLLHLL。由于古汉字的结构信息大多表现为高频特征,因此仅保留3个高频特征(HHHLLH)进行拼接并下采样,得到与空域特征尺寸相同的频域特征FH,随后将FIFH进行元素相乘,得到双域聚合特征FA。接着,将FA输入MSFRM,在不同感受野下进行多尺度特征提取和细化,得到输出特征FF。然后,FF经8个卷积残差块补全得到特征FO。最后FO经过解码器生成最终的补全图像Ia。模型训练时,采用像素级重建损失约束补全图像Ia与真实图像Ig的差异,并引入高频感知损失以增强笔画和结构细节的复原质量。

图 2 基于双域自适应融合与特征细化的古汉字图像补全网络 Fig. 2 Ancient Chinese character image inpainting network based on dual-domain adaptive fusion and feature refinement

2.2 双域特征融合模块

为提高模型对字体结构和笔画细节的特征提取能力,本文提出DDFFM,由编码器、HFFEM以及特征融合单元组成。DDFFM首先利用边界填充操作对图像进行反射填充,随后经过由3层卷积和ReLU(·)激活函数级联构成的组合函数H(·)来提取空域特征FI。其公式如下所示:

$ \begin{aligned} & \ \ \ \ \ \ \ \ \ F_I=H\left(\operatorname{ReflectionPad2D}\left(\left[I, I_{\mathrm{m}}\right]\right)\right)=\operatorname{ReLU} \\ & \left(\operatorname{Conv}_ { L } \left(\operatorname {ReLU}\left(\cdots \operatorname { R e L U } \left(\operatorname{Conv}_1(\operatorname{ReflectionPad2D})\right.\right.\right.\right. \\ & \left.\left.\left.\left.\left(\left[I, I_m\right]\right)\right) \cdots\right)\right)\right), \end{aligned} $ (1)

其中,ReflectionPad2D(·)是图像边界填充函数,通过镜像反射边界像素来对二维图像边界进行填充,ConvL表示第l层的卷积操作。组合函数Η(·)的第1层卷积将输入通道数从4映射到64,用来提取初始特征;第2层卷积将输入通道数从64映射到128(步长为2),同时将特征尺寸从H×W降低为H/2×W/2;第3层卷积将输入通道数从128映射到256(步长为2),同时将特征尺寸从H/2×W/2降低为H/4×W/4。

HFFEM(图 3)通过DWT将图像分解为1个低频特征(LL)和3个高频特征(LHHLHH),公式分别为

$ L L=\sum\nolimits_{i=0} \sum\nolimits_{j=0} x \cdot \varphi(i) \cdot \varphi(j), $ (2)
$ L H=\sum\nolimits_{i=0}^{\frac{N}{2}-1} \sum\nolimits_{j=0}^{\frac{N}{2}-1} x \cdot \varphi(i) \cdot \psi(j), $ (3)
$ H L=\sum\nolimits_{i=0}^{\frac{N}{2}-1} \sum\nolimits_{j=0}^{\frac{N}{2}-1} x \cdot \psi(i) \cdot \varphi(j), $ (4)
$ H H=\sum\nolimits_{i=0}^{\frac{N}{2}-1} \sum\nolimits_{j=0}^{\frac{N}{2}-1} x \cdot \psi(i) \cdot \psi(j), $ (5)
图 3 HFFEM结构 Fig. 3 HFFEM structure

其中,x是图像中的原始像素值,φ(·)是尺度函数,用于提取信号的低频成分,ψ(·)是小波函数,用于提取信号的高频成分。N是图像的总像素数,ij是索引变量,表示图像中的位置。

随后,为了对高频特征进行拼接并匹配图像的空域特征维度,HFFEM对高频特征进行融合并下采样,得到高频特征FH

$ F_H=\operatorname{Down}(H H+H L+L H), $ (6)

其中,FH代表最终提取的高频特征,Down(·)表示下采样操作。

最后,在得到高频特征FH和图像空域特征FI后,将这两个特征进行元素相乘得到最终的双域聚合特征FA。其公式如下所示:

$ F_A=F_I \cdot F_H 。$ (7)
2.3 多尺度特征细化模块

为了提升图像的多尺度表征能力,本文提出MSFRM如图 2所示。首先,为了捕获不同尺度的关键信息,MSFRM采用3×3、5×5和7×7卷积核提取局部和全局特征,输入特征FA经过不同卷积操作后的输出为

$ F_{s i}=\operatorname{ReLU}\left(\operatorname{Conv}_{i \times i}\left(F_A\right)\right), $ (8)

其中,Convi×i表示卷积核为i×i的卷积层。最终得到3种不同尺度的特征,即Fs3Fs5Fs7

然后,为了有效整合不同尺度的特征,将Fs3Fs5Fs7进行通道维度拼接得到特征FC

$ F_C=\operatorname{Concat}\left(F_{s 3}, F_{s 5}, F_{s 7}\right), $ (9)

其中,Fs3Fs5Fs7表示经过不同卷积核后得到的局部和全局特征。

接着,为使模型能够自动关注重要的特征通道,减少冗余信息,强化关键特征的表达,利用高效通道注意力(Efficient Channel Attention,ECA)机制自适应调整FC中不同尺度特征的权重,使模型更精准地关注文字结构和纹理信息。ECA机制如图 4所示,具体操作如下:

$ F_E=\left[\sigma\left(\operatorname{Conv}_{1 \times 1}\left(\operatorname{GAP}\left(F_C\right)\right)\right)\right] \times F_C, $ (10)
图 4 ECA机制 Fig. 4 ECA mechanism

其中,Conv1×1表示卷积核为1×1的卷积层,GAP为全局平均池化,σ(·)为Sigmoid激活函数,FE为经过通道注意力后的特征。

最后,使用1×1卷积进行特征变换以降低通道维度,得到编码细化后的特征FF

$ F_F=\operatorname{ReLU}\left(\operatorname{Conv}_{1 \times 1}\left(F_E\right)\right) \text { 。} $ (11)
2.4 解码模块

解码模块由膨胀卷积残差块和解码器组成,用于生成最终的补全图像。具体来说,编码细化特征FF先经并行膨胀卷积(扩张率r={1, 2, …, 8})提取多尺度上下文信息,得到特征集合{F1, F2, …, FB}。然后,将所有膨胀卷积的输出在通道维度上拼接,并经过1×1卷积进行特征融合:

$ F_{\text {fuse }}=\operatorname{Conv}_{1 \times 1}\left(\operatorname{Concat}\left(F_1, F_2, \cdots, F_B\right)\right), $ (12)

其中,Ffuse表示融合后的特征,B为不同扩张率的膨胀卷积所得到的特征数量。

接着,利用门控机制生成加权系数M,加权系数M的值介于0和1之间,用于控制细化特征FF和融合特征Ffuse在最终输出中的加权比例:

$ M=\sigma\left(\operatorname{Conv}_{3 \times 3}\left(F_F\right)\right) \text { 。} $ (13)

最终输出特征FO由编码细化特征FF与融合特征Ffuse加权融合得到,其公式如下所示:

$ F_O=F_F \cdot(1-M)+F_{\text {fuse }} \cdot M \text {, } $ (14)

其中,FO表示补全后的特征。

最后,将FO送入解码器得到最终的补全图像Ia。具体来说,FO先经过两次上采样以提高特征图的分辨率,同时将通道维度降低到64,再经过3×3卷积生成补全图像Ia

$ I_a=\operatorname{Conv}_{3 \times 3}\left(\operatorname{UpConv}\left(F_O\right) \times 2\right), $ (15)

其中,UpConv表示上采样卷积操作。

2.5 损失函数

古汉字图像补全模型既要保证补全图像的逐像素重建精度与视觉保真性,也要保证重建文字的准确性。为此,除了感知损失[21]和逐像素的L1损失[30]外,本文还引入高频感知损失。首先L1损失的目的是以保证像素级重建精度,其公式如下:

$ L_1=E_{I_a, I_g}\left[\left\|I_a-I_g\right\|_1\right], $ (16)

其中,Ig为真实图像。

感知损失Lp用于衡量图像在高层语义特征空间的相似性:

$ L_p=\sum\nolimits_l\left\|\theta_l\left(I_a\right)-\theta_l\left(I_g\right)\right\|_1, $ (17)

其中,θl代表VGG预训练模型的第1层特征。

为了进一步提高笔画与字体结构的复原质量,本文提出高频感知损失Lf,其公式如下所示:

$ \begin{aligned} & \quad \quad L_f=\sum\nolimits_{f \in\{H H, H L, L H\}} \| \mathrm{DWT}_f\left(I_a\right)- \\ & \mathrm{DWT}_f\left(I_g\right) \|_1, \end{aligned} $ (18)

其中,DWTf(·)表示对输入图像进行离散小波变换后,得到的高频子带{HHHLLH}中的某一频率子带。

综上,模型的总损失函数Ltotal

$ L_{\text {total }}=\lambda_1 L_1+\lambda_2 L_p+\lambda_3 L_f, $ (19)

其中,λi为权重系数,本文具体设置为λ1=1,λ2=10-4λ3=1,用于平衡不同损失项对训练的影响。通过引入高频感知损失,本文模型不仅在像素层面优化补全效果,同时在频域信息上增强对古汉字结构的感知,使得补全后的文字结构更加清晰。

3 实验与结果分析 3.1 数据集和评估指标 3.1.1 古汉字图像补全数据集

本文首次构建了古汉字图像补全的数据集HanInpaint,包含1 386张训练图像和347张测试图像,图像尺寸为512×512。古汉字图像数据来源广泛,主要采集自古籍文献、公共古诗文数据库以及出版物资源。数据涵盖多个历史时期的碑帖作品,包括楷书、篆书、草书等多种字体风格。通过生成随机掩码的方式,数据集生成了随机缺损、局部遮挡、条状残缺等多种缺失模式,有效模拟真实古汉字的破损情况。此外,数据集中引入不同的背景颜色和材质纹理,以进一步增加补全任务的复杂性和挑战性。在数据预处理过程中,首先对原始图像进行去噪与对比度增强,以提升图像清晰度和文本可辨性,随后统一尺寸为512×512,以保证训练与评估的一致性。

3.1.2 评估指标

在实验中,本文采用平均绝对误差(Mean Absolute Error,MAE)、峰值信噪比(Peak Signal-to-Noise Ratio,PSNR)、结构相似性(Structural Similarity Index Measure,SSIM)、学习感知图像块相似度(Learned Perceptual Image Patch Similarity,LPIPS)和Fréchet初始距离(Fréchet Inception Distance,FID)评估补全图像质量。MAE衡量像素级平均绝对差异,计算方式如下:

$ \text { MAE }=\frac{1}{H W} \sum\limits_{i=1}^H \sum\limits_{j=1}^W\left|I_a(i, j)-I_g(i, j)\right| 。$ (20)

PSNR用于评估图像恢复的整体视觉保真度,计算方式如下:

$ \mathrm{MSE}=\frac{1}{H W} \sum\limits_{i=1}^H \sum\limits_{j=1}^W\left(I_a(i, j)-I_g(i, j)\right)^2, $ (21)
$ \mathrm{PSNR}=10 \log \left(\frac{\mathrm{MAX}^2}{\mathrm{MSE}}\right), $ (22)

其中,MAX是图像可能的最大像素值(对于8位图像是255)。

SSIM用于评估亮度、对比度和结构相似度,计算方式如下:

$ \mathrm{SSIM}=\frac{\left(2 \mu_{I_a} \mu_{I_g}+c_1\right)\left(2 \delta_{I_a I_g}+c_2\right)}{\left(\mu_{I_a}^2+\mu_{I_g}^2+c_1\right)\left(\xi_{I_a}^2+\xi_{I_g}^2+c_2\right)}, $ (23)

其中,μ是像素值均值,ξ是像素值方差,δ是像素值协方差,c1c2是极小的常数,用于确保分母和分子的稳定性。

LPIPS基于深度学习用于衡量感知相似性,通过计算两幅图像在预训练深度网络提取的深层特征距离,度量其相似性。计算方式如下:

$ \mathrm{LPIPS}=\sum\limits_{i=1}^N d\left(f\left(I_a\right)_i-f\left(I_g\right)_i\right), $ (24)

其中,f(·)是一个预先训练好的感知学习模型(VGG),它将图像映射到感知空间特征向量。f(Ia)if(Ig)i分别表示图像IaIg在感知空间中的第i个特征向量,d(·)是均方误差函数。

FID用于衡量图像分布距离,计算方式如下:

$ \begin{aligned} & \quad \quad \mathrm{FID}=\left\|\mu_{I_a}-\mu_{I_g}\right\|_2^2+\operatorname{Tr}\left(\delta_{I_a}+\delta_{I_g}-\right. \\ & \left.2\left(\delta_{I_a} \delta_{I_g}\right)^{\frac{1}{2}}\right) \end{aligned} $ (25)

其中,Tr(·)表示矩阵的迹,用于度量协方差矩阵的差异。

3.2 实验设置

实验在Pytorch框架下进行,开发环境为PyTorch 1.10.1、CUDA 11.8、Python 3.8、batch size设置为8、学习率0.000 1、输入图像尺寸为512×512,在RTX A6000 GPU服务器上迭代105次完成训练。

3.3 对比实验 3.3.1 定量实验比较

本文选取基于频域卷积的方法Lama[20]、基于生成对抗网络的方法AOT-GAN[18]、以及基于特征增强的方法LGNet[22]和MEDFE[11]作为对比基线模型。实验结果(表 1)表明,本文提出模型的MAE为0.03,PSNR为31.56 dB,SSIM为0.973 1,LPIPS为0.11,FID为19.63,在各个指标上均优于对比模型。与AOT-GAN相比,本文提出模型的MAE降低了0.14,在PSNR中提高了0.87dB,在SSIM中提高了0.021 6,LPIPS降低了0.05,FID降低了8.35。

表 1 HanInpaint数据集上的对比实验结果 Table 1 Result of comparison experiment on the HanInpaint dataset
模型
Model
平均绝对误差
MAE
峰值信噪比/dB
PSNR/dB
结构相似性指数
SSIM
学习感知图像块相似度
LPIPS
弗雷歇初始距离
FID
Lama[20] 0.28 22.10 0.852 1 0.19 29.84
LGNet[22] 0.12 30.68 0.963 4 0.12 20.28
AOT-GAN[18] 0.17 30.69 0.951 5 0.16 27.98
MEDFE[11] 0.16 30.71 0.965 8 0.15 27.71
Ours 0.03 31.56 0.973 1 0.11 19.63

3.3.2 定性实验比较

通过HanInpaint数据集的不同字体与缺损模式实验(图 5)可见,本文提出的模型在不同字体和缺损模式下均能保持较高的结构相似性和细节还原度,具有较强的泛化能力。具体来说,Lama和AOT-GAN的修复结果在边缘处存在伪影,MEDFE容易产生结构错误,LGNet在语义上正确但细节不足。相比之下,本文方法通过双域特征融合模块和多尺度特征细化模块有效地缓解了字体结构失真的情况,并且高频感知损失使得模型能够生成更加规范的修复图像,保留更多细节和边缘信息。因此,本文方法对于多种字体风格的古汉字图像补全均具有良好的适用性,能够应用到古籍、碑刻修复等场景,可以有效地辅助专家对破损古籍、碑刻中的文字进行修复。

图 5 HanInpaint数据集在不同模型中的补全结果对比 Fig. 5 Comparison of inpainting results of HanInpaint dataset in different models

3.3.3 参数量与显存消耗比较

各模型的参数量与显存消耗如表 2所示。本文提出模型的参数量为25.3 M,显存占用约3.5 GB(3 521 MB),在保持性能领先的同时具有较高的计算效率与应用可行性,展现出良好的工程应用潜力。

表 2 不同模型的参数量和显存消耗比较 Table 2 Comparison of the number of parameters and memory consumption of different models
模型
Model
参数量/M
Parameter/M
显存/MB
Memory/MB
Lama[20] 74.0 8 742
LGNet[22] 67.1 5 697
AOT-GAN[18] 28.4 3 872
MEDFE[11] 43.1 5 501
Ours 25.3 3 521

3.4 消融实验

为验证本文提出模型中各模块的有效性,在HanInpaint数据集上进行消融实验,依次移除MSFRM、DDFFM以及HFALoss,来观察模型性能变化,结果如表 3所示。

表 3 在HanInpaint数据集上的消融实验 Table 3 Ablation experiments on the HanInpaint dataset
模型设置
Model setup
平均绝对误差
MAE
峰值信噪比/dB
PSNR/dB
结构相似性指数
SSIM
Full model 0.03 31.56 0.973 1
w/o HFALoss 0.08 31.32 0.968 1
w/o MSFRM 0.10 31.13 0.964 5
w/o DDFFM 0.13 30.98 0.958 9
Baseline 0.17 30.69 0.951 5

首先,移除MSFRM后,MAE上升了0.07,PSNR降低了0.43 dB,SSIM降低了0.008 6,这是因为在移除MSFRM后,模型不能对融合后的双域特征进行多尺度提取和细化,导致补全图像清晰度与细节保真度降低。其次,在移除DDFFM后,模型的MAE上升了0.1,PSNR降低了0.58 dB,SSIM降低了0.014 2,这是由于在移除DDFFM后,模型通过频域提取文字结构等高频信息的能力减弱,从而导致补全后的图像字体结构清晰度与细节保真度降低。再次,在移除HFALoss后,模型的MAE上升了0.05,PSNR降低了0.24 dB,SSIM降低了0.005。这是由于频域感知损失约束补全图像与真实图像在频域上的差异,从而增强笔画细节的复原质量。移除该损失后,模型无法利用频域信息来进一步优化补全效果,导致笔画边缘细节恢复能力下降。此外,消融实验定性结果(图 6)也表明在分别移除各个模块后图像的补全质量都有降低。

图 6 消融实验结果对比 Fig. 6 Comparison of ablation experiment results

3.5 高频感知损失权重参数实验

为进一步验证所提出的高频感知损失有效性,本文固定λ1=1、λ2=10-4,对λ3分别取{0.1, 0.5, 1, 5, 10}进行参数实验。如表 4所示,λ3取值过高或过低均会对模型性能产生不利影响。当λ3过小时,模型对古汉字笔画结构与细节的复原能力不足,导致性能下降;当λ3取值为1时,各项指标均达到最优。然而,若λ3取值过大,模型性能不仅无法进一步提升,还可能出现下降,这可能是由于模型过度关注高频信息导致笔画结构过度锐化。

表 4 高频感知损失权重参数λ3比较 Table 4 Comparison of weight parameter λ3 of high-frequency-aware loss
损失设置
Loss setup
平均绝对误差
MAE
峰值信噪比/dB
PSNR/dB
结构相似性指数
SSIM
λ3=0.1 0.09 30.86 0.969 0
λ3=0.5 0.06 31.41 0.970 2
λ3=1 0.03 31.56 0.973 1
λ3=5 0.03 31.52 0.972 9
λ3=10 0.05 31.48 0.971 3

4 结论

本文针对古汉字图像补全任务,首次构建古汉字图像补全数据集HanInpaint,为相关研究提供标准化的训练数据与评价基准。针对通用图像补全方法在古汉字图像补全中存在的结构失真与纹理恢复不准确等问题,本文提出一种基于双域自适应融合与特征细化的古汉字图像补全方法。具体来说,设计双域特征融合模块,通过联合空域与频域信息实现跨域特征自适应融合,从而增强模型对古汉字结构信息的建模能力。同时引入多尺度特征细化模块,充分利用不同尺度的局部与全局特征,提高补全图像的清晰度与细节保真度。此外,本文设计高频感知损失,对补全图像与真实图像之间的高频差异进行约束,进一步提升笔画细节的复原质量。实验结果表明,本文所提方法在HanInpaint数据集上表现优异,相较于现有的通用图像补全方法,在字体结构保持和笔画细节修复方面具有明显优势。未来,笔者计划进一步扩展HanInpaint数据集的规模与多样性,以涵盖更多字体、书写风格及复杂场景,提升模型的泛化能力,同时优化补全模型的生成能力,以提升其在真实场景下的应用价值。

参考文献
[1]
ZHONG Z, YIN F, ZHANG X Y, et al. Handwritten Chinese character blind inpainting with conditional generative adversarial nets[C]//2017 4th IAPR Asian Conference on Pattern Recognition (ACPR). Piscataway: IEEE, 2017: 804-809.
[2]
SONG G, LI J W, WANG Z. Occluded offline handwritten Chinese character inpainting via generative adversarial network and self-attention mechanism[J]. Neurocomputing, 2020, 415: 146-156. DOI:10.1016/j.neucom.2020.07.046
[3]
WANG J H, PAN G, SUN D, et al. Chinese character inpainting with contextual semantic constraints[C]//Proceedings of the 29th ACM International Conference on Multimedia. New York: ACM, 2021: 1829-1837.
[4]
LI H L, ZHONG Z Z, GUAN W, et al. Generative character inpainting guided by structural information[J]. The Visual Computer, 2021, 37(9): 2895-2906.
[5]
WANG D H, LIU C L, YU J L, et al. CASIA-OLHWDB1: a database of online handwritten Chinese characters[C]//2009 10th International Conference on Document Analysis and Recognition. Piscataway: IEEE, 2009: 1206-1210.
[6]
LIU C L, YIN F, WANG D H, et al. CASIA online and offline Chinese handwriting databases[C]//2011 International Conference on Document Analysis and Recognition. Piscataway: IEEE, 2011: 37-41.
[7]
TANG L M, RUIZ N, CHU Q H, et al. RealFill: reference-driven generation for authentic image completion[J]. ACM Transactions on Graphics, 2024, 43(4): 1-12.
[8]
ALKOBI N, ROTT SHAHAM T, MICHAELI T. Internal diverse image completion[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). Piscataway: IEEE, 2023: 648-658.
[9]
覃晓, 彭磊, 廖惠仙, 等. MSViT: 融合多尺度特征的轻量化图像分类混合模型[J]. 广西科学, 2024, 31(5): 912-924.
[10]
徐正丽, 肖素芳, 杨明浩. 基于无需校准激光雷达曲线与RGB-D图像的数据融合方法[J]. 广西科学, 2024, 31(5): 1038-1048.
[11]
LIU H Y, JIANG B, SONG Y B, et al. Rethinking image inpainting via a mutual encoder-decoder with feature equalizations[C]//European Conference on Computer Vision (ECCV). Cham: Springer, 2020: 725-741.
[12]
YU T, GUO Z Y, JIN X, et al. Region normalization for image inpainting[C]//Proceedings of the AAAI Conference on Artificial Intelligence. Menlo Park: AAAI Press, 2020: 12733-12740.
[13]
ZHAO S Y, CUI J, SHENG Y L, et al. Large scale image completion via co-modulated generative adversarial networks[EB/OL]. (2021-03-18)[2025-08-15]. https://arxiv.org/abs/2103.10428.
[14]
ZHU S P, FANG P F, ZHU C J, et al. Text image inpainting via global structure-guided diffusion models[C]//Proceedings of the AAAI Conference on Artificial Intelligence. Menlo Park: AAAI Press, 2024: 7775-7783.
[15]
LIU J W, WANG Q, FAN H J, et al. Residual denoising diffusion models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE, 2024: 2773-2783.
[16]
JU X, LIU X, WANG X T, et al. BrushNet: a plug-and-play image inpainting model with decomposed dual-branch diffusion[C]//European Conference on Computer Vision. Cham: Springer, 2024: 150-168.
[17]
刘畅, 张玲, 何英豪. 边缘引导和拉普拉斯金字塔分解的古文本图像修复算法[J]. 计算机辅助设计与图形学学报, 2024, 36(6): 884-894.
[18]
ZENG Y H, FU J L, CHAO H Y, et al. Aggregated contextual transformations for high-resolution image inpainting[J]. IEEE Transactions on Visualization and Computer Graphics, 2023, 29(7): 3266-3280. DOI:10.1109/TVCG.2022.3156949
[19]
JAIN J, ZHOU Y, YU N, et al. Keys to better image inpainting: structure and texture go hand in hand[C]//Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. Piscataway: IEEE, 2023: 208-217.
[20]
SUVOROV R, LOGACHEVA E, MASHIKHIN A, et al. Resolution-robust large mask inpainting with Fourier convolutions[C]//Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. Piscataway: IEEE, 2022: 3172-3182.
[21]
KARRAS T, LAINE S, AITTALA M, et al. Analyzing and improving the image quality of StyleGAN[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE, 2020: 8110-8119.
[22]
QUAN W Z, ZHANG R S, ZHANG Y, et al. Image inpainting with local and global refinement[J]. IEEE Transactions on Image Processing, 2022, 31: 2405-2420. DOI:10.1109/TIP.2022.3152624
[23]
尹甜甜, 刘婷, 郭一娜. 面向古汉字修复的单通道盲去卷积算法研究[J]. 小型微型计算机系统, 2021, 42(2): 414-417.
[24]
涂超虎, 易尧华, 王凯丽, 等. 自适应多级特征融合的场景古汉字识别[J]. 武汉大学学报(信息科学版), 2025, 50(12): 2592-2600.
[25]
胡根生, 孙莹莹, 徐玲英, 等. 基于混合核WLS-SVR的古汉字识别[J]. 中国科学技术大学学报, 2015, 45(4): 321-328.
[26]
BRACEWELL R, KAHN P B. The Fourier transform and its applications[J]. American Journal of Physics, 1966, 34(8): 712.
[27]
FRITSCHE M, GU S H, TIMOFTE R. Frequency separation for real-world super-resolution[C]//2019 IEEE/CVF International Conference on Computer Vision Workshop. Piscataway: IEEE, 2019: 3599-3608.
[28]
DAUBECHIES I. Ten lectures on wavelets[M]. Philadelphia: Society for Industrial and Applied Mathematics, 1992.
[29]
ZHANG K, ZUO W M, ZHANG L. Learning a single convolutional super-resolution network for multiple degradations[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE, 2018: 3262-3271.
[30]
GATYS L A, ECKER A S, BETHGE M. Image style transfer using convolutional neural networks[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE, 2016: 2414-2423.