2. 北方民族大学 图像图形智能处理国家民委重点实验室 宁夏 银川 750021
2. The Key Laboratory of Images & Graphics Intelligent Processing of State Ethnic Affairs Commission, North Minzu University, Yinchuan 750021, China
命名实体识别(named entity recognition, NER)是自然语言处理领域的一项关键任务,其主要目标是提取文本中有意义的信息,使得计算机能够更好地理解和处理人类语言。NER在各种下游任务中有着广泛的应用,例如情感分析[1]、问答系统[2]、文本分类[3]、机器翻译[4]和信息抽取[5]等。
近年来,随着深度学习的发展,越来越多的神经网络模型被提出,且成功应用于NER。目前主流的基于深度学习的中文NER方法有基于超图的方法、基于序列标记的方法和基于跨度的方法。基于超图的方法通常会将问题转换为序列标记任务[6],且由于超图的复杂性,基于超图的模型普遍存在很难训练的问题。中文实体边界易受上下文和语义影响,而基于序列标记的方法[7]虽然被广泛应用,但在处理中文实体边界时,其有效性常因未能对边界进行特殊标记而受到影响。基于跨度的方法[8]通过直接识别文本内实体的跨度,避免了对单个字符的标记,可有效捕获实体边界。此外,通过准确标注实体跨度的方法能够更准确地定位实体,并能提供更丰富的上下文背景,进一步提高实体识别的准确性和效率。
通过以上研究可知,基于跨度的方法在命名实体识别中具有一定的优势。但自然语言具有高度的多样性和复杂性,在不同领域或场景下,句法结构和表达方式可能会显著不同。在法律、医学等领域,专业术语和长句结构更为常见,这些复杂的表达方式导致NER模型在处理长距离依赖和复杂序列数据时,难以准确捕捉实体边界及全局和局部信息。
针对以上问题,本文使用基于跨度的方法提出一种结合对抗训练的双通道特征融合模型(RFBG),利用RoBERTa-wwm-ext预训练模型作为特征提取层,其动态掩码策略可以更好地获取全局特征。同时,在预训练模型的嵌入层引入对抗训练添加扰动,以缓解模型的局部不稳定问题,增强模型的鲁棒性和抗干扰能力。使用GlobalPointer作为解码器处理实体表征,但其缺乏对上下文语义信息的利用,且考虑仅在解码器前使用BiLSTM进行特征融合,会导致模型对复杂序列及长距离依赖关系的处理欠佳。多头注意力在对全局信息的理解及长距离依赖的捕捉能力表现良好,但仅在BiLSTM后添加多头注意力又缺乏对局部信息的处理,因此,提出多头注意力与时间步并行的双通道特征融合模块以强化语义信息、提升模型对全局和局部信息的捕捉能力。
1 RFBG模型模型的特征提取层采用RoBERTa-wwm-ext作为词嵌入模型,将文本编码转换为词向量。使用快速梯度法(fast gradient method, FGM)对嵌入层添加扰动,特征融合层使用BiLSTM,并使用多头注意力(multi-head attention, MHA)和时间步(TIME)组成的双通道模块来关注汉字的时序信息,以增强语义连接。最后,使用GlobalPointer作为解码层来获取实体边界,并提取相关实体。模型结构如图 1所示,总体可分为特征提取层、特征融合层和解码层。
|
图 1 RFBG模型框架图 Fig. 1 The RFBG model framework diagram |
特征提取层是NER模型中的基础组件,它负责将文本数据转化为密集的向量表示。在NER任务中,选择适合的特征提取方法对模型的性能至关重要。本节将介绍在RFBG模型中采用的特征提取方法:RoBERTa-wwm-ext和FGM。RoBERTa-wwm-ext是基于BERT的一种预训练模型,在多种自然语言处理任务上都展现了较为出色的性能,FGM是一种用于增强模型鲁棒性的对抗训练技术。
1.1.1 RoBERTa-wwm-extRoBERTa-wwm-ext[9]模型从BERT[10]演变而来,BERT模型使用多层双向Transformer[11]作为主要组成部分,并以掩码语言模型和下一句预测(next sentence predict, NSP)作为模型的预训练目标。RoBERTa-wwm-ext模型保留了BERT模型中的多层双向Transformer结构,并在预训练方法上进行了以下创新:
1) 将BERT模型的静态掩码机制改为动态掩码机制,使得模型能够在训练过程中更好地捕捉数据的全局特征;
2) 去除了NSP损失以提高模型的学习效率;
3) 采用字节对编码(byte pair encoder, BPE)方法对更大的数据集进行训练。
鉴于中文句子的特性,RoBERTa-wwm-ext模型采用全词掩码(whole word masking, WWM)策略进行掩码操作。WWM的核心思想是,如果一个词的某个字符被屏蔽,那么同属于该词的其他字符也会被屏蔽。在中文数据集上应用这种方法,使得预训练的语言模型能够学习字符间的词级关系,增强了模型的语义建模能力。
1.1.2 FGM为了增强模型的鲁棒性,FGM[12]通过在RoBERTa-wwm-ext嵌入层的输出上施加对抗性扰动,帮助模型更好地抵御对抗性攻击,提高对噪声和干扰的处理能力,从而增强模型的稳健性和泛化能力。FGM的训练过程包括两个步骤。
1) 内部损失函数值最大化。在模型的训练中,通过引入损失值增加的扰动来影响模型,并在给定的空间中确定最大的影响函数,因此,需要最大化内部损失函数的值。
2) 任务判别损失最小化。在扰动嵌入层后,为使模型的输出分布能够与原始分布相匹配,在已知最大影响函数的条件下,寻找能最小化任务判别损失的最优参数。
Madry等[13]总结了对抗性训练的工作,将对抗训练统一表示为Min-Max公式,即
| $ \min \theta E(x, y) \sim E\left[\max r_{\mathrm{adv}} \in s L\left(\theta, x+r_{\mathrm{adv}}, y\right)\right], $ | (1) |
其中:θ是模型参数;E表示对抗性示例的预期损失;L是单个样本的损失;x代表输入;radv是附加的扰动;y代表标签。对于FGM算法,输入的相应梯度为
| $ g=\nabla x L(\alpha, x, y) 。$ | (2) |
对于式(1)中的最大部分,扰动可以随着损耗的方向上升,梯度变化公式为
| $ r_{\mathrm{adv} 0}=\alpha \operatorname{sgn}(g), $ | (3) |
其中:α表示对抗性学习的超参数;sgn是阶跃函数;g是x的级数。与FGSM[14]不同的是,FGM方法使用梯度的第二范式,这可以提高模型的稳定性。FGM可表示为
| $ r_{\mathrm{adv}}=\alpha g /\|g\|_{2 }。$ | (4) |
特征融合层由BiLSTM和双通道模块组成。BiLSTM通过对输入序列的双向编码,结合前向和后向信息生成富含上下文的隐藏状态;双通道模块包含MHA和TIME层,其中MHA捕捉序列中位置间的长距离依赖,TIME则通过线性变换增强隐藏状态的表征能力,以提升模型对复杂序列的处理。
尽管BiLSTM能捕捉前后文信息,但其在复杂序列和长距离依赖的处理上较弱。MHA善于捕捉全局信息,但欠缺局部信息的精确处理,因此设计了双通道模块。该模块结合TIME层和MHA层,通过BiLSTM的前向和后向隐藏状态生成深层语义表示,TIME侧重局部依赖,MHA侧重全局依赖。二者并行捕捉局部和全局信息,使模型获得丰富全面的深层语义表示,提升实体边界的定位与识别能力,对不同信息类型的处理更为灵活准确。
TIME层是一个时间分布的线性层,其结构如图 2所示,它用于对BiLSTM输出的前向和后向隐藏状态进行线性变换,捕捉实体的局部特征。如式(5)所示,即
| $ \operatorname{TIME}(\boldsymbol{I})=\boldsymbol{W}_{t} \cdot \boldsymbol{I}+b_{t}, $ | (5) |
|
图 2 TIME结构图 Fig. 2 The structure of TIME |
其中:I是BiLSTM输出的隐藏状态向量;Wt是待学习的线性变换的权重矩阵;bt是偏置参数。
该线性变换被应用到每个时间步的隐藏状态上,使得每个时间步的隐藏状态都经过相同的线性变换,从而得到处理后的隐藏状态。将该隐藏状态展平后传递给编码器,其中的Dropout、Linear和激
活函数的堆叠有助于捕捉复杂的特征,增强模型的表达能力。通过编码器后将输入数据转换为高层次的特征表示,解码器从特征中重构数据。编码器和解码器有助于模型学习数据的内在结构,提高特征提取的有效性和鲁棒性。最后将展平的输入恢复到原来的时间维度。
MHA层用于从BiLSTM输出的前向和后向隐藏状态中捕捉不同位置之间的相关性,增强模型对全局信息的理解以及长距离依赖的捕捉能力。
1.3 解码层GlobalPointer[15]是一种基于跨度的解码方法,可以无差别识别嵌套实体和非嵌套实体,其中的旋转位置编码(rotary position embedding, RoPE)是GlobalPointer的核心思想。RoPE通过与注意力机制配合,从而以绝对位置编码的方式实现相对位置编码。RoPE的加入可以增强GlobalPointer对实体位置信息的捕捉,进而提升识别效果。
GlobalPointer上三角部分可以完全构建实体信息,因此可以直接省略矩阵下三角部分。对于句子中的实体,当开始位置是i,结束位置是j时,坐标(i, j)标记为1,其他标记为0,表示句中存在实体或不存在实体。如公式(6)~(8)所示,即
| $ \boldsymbol{q}_{i, \alpha}=w_{q, \alpha} \boldsymbol{h}_{i}+b_{q, \alpha}, $ | (6) |
| $ \boldsymbol{k}_{j, \alpha}=w_{k, \alpha} \boldsymbol{h}_{j}+b_{k, \alpha}, $ | (7) |
| $ s_{\alpha}(i, j)=\boldsymbol{q}_{i, \alpha}^{\mathrm{T}}, \boldsymbol{k}_{j, \alpha}, $ | (8) |
其中:sα为候选片段[i, j]表示的实体类型α的得分;hi和hj表示字符向量;wq, a,wk, a,bq, α,bk, α表示矩阵参数和偏置参数;qi, α,kj, α表示输出向量。但式(8)中并没有包含相对位置信息,这可能会导致识别过程中效果大幅下降,添加RoPE后如式(9)所示,
| $ \begin{align*} & s_{\alpha}(i, j)^{\prime}=\left(\boldsymbol{R}_{i} \boldsymbol{q}_{i}, \alpha\right)^{\mathrm{T}}\left(\boldsymbol{R}_{j} \boldsymbol{k}_{j}, \alpha\right)=\boldsymbol{q}_{i, \alpha}^{\mathrm{T}} \boldsymbol{R}_{i}^{\mathrm{T}} \boldsymbol{R}_{j} \boldsymbol{k}_{j}, \\ & \alpha=\boldsymbol{q}_{i, \alpha}^{\mathrm{T}} \boldsymbol{R}_{i-j} \boldsymbol{k}_{j, \alpha}, \end{align*} $ | (9) |
其中:Ri,Rj表示正交矩阵;Ri-j表示相对位置向量。
GlobalPointer中设计的损失函数本质为单目标多分类的推广,适用于总类别大、目标类别小的多标签分类问题,具体可表示为
| $ { Loss }=\ln \left(1+\sum\limits_{(i, j) \in P_\alpha} \mathrm{e}^{-s_\alpha(i, j)}\right)+\ln \left(1+\sum\limits_{(i, j) \in Q_\alpha} \mathrm{e}^{s_\alpha(i, j)}\right), $ | (10) |
其中:Pα表示样本中所有类型为α的实体的首尾集合;Qα表示样本中所有非实体或者类型非α的实体的首尾集合。在解码阶段,所有满足sa(i, j)的片段都被视为类型为α的实体输出。
2 实验设计与分析 2.1 实验设置及数据集介绍本实验在NVIDIA GeForce RTX 4090上单卡运行,显存为24 GB,虚拟环境中使用的PyTorch版本为1.12.0+cu116,Python版本为3.8.18,Transformers版本为4.3.2。
统一参数可确保性能差异主要来自数据集和模型本身的特性,而不是参数调整的结果。RFBG模型中使用的各参数为:学习率为2e-5;训练批次和轮数分别为16和60;使用的优化器为Adam;随机种子设置为2 333;最大序列长度设置为512;scheduler使用CAWR;dropout设置为0.5。
实验使用了4个广泛使用的公开数据集,分别是Resume、Weibo、CMeEE和CLUENER2020,以及1个公开数据集Video_music_book。表 1统计了这些数据集的训练集、测试集和验证集的数量,并列出了各自的实体类型。
|
|
表 1 数据集相关信息 Tab. 1 Information of datasets |
Resume是新浪财经收集的简历数据集,包含了中国股票公司高管的简历,文本较为规范;Weibo为NER标注的微博信息语料库,文本较为口语化,包含大量流行语且数据集的噪声较大,其中NOM表示泛指,NAM表示特指;CMeEE来自中文医疗信息处理挑战榜,主要面向中文医学NER,其中包含了嵌套实体;CLUENER2020基于清华大学开源的THUCTC文本分类数据集,实体类型丰富,可用于细粒度的NER;Video_music_book为粗粒度数据集,收集了一万余条视频、音乐、书籍名的数据,其中的难点之一为同一名称既可能为书籍名,也可能为视频名。
2.2 评测标准NER评测标准通常包括准确率(P)、召回率(R)和F1值(F1)。
| $ \begin{aligned} P & =\frac{T P}{T P+F P} ,\\ R & =\frac{T P}{T P+F N}, \\ F 1 & =2 \times \frac{P \times R}{P+R}, \end{aligned} $ |
其中:TP表示实体被正确预测的数量;FP表示非实体被预测为实体的数量;FN表示非实体被预测为非实体的数量。
2.3 对比实验及分析本实验采用了1个基线模型BiLSTM-CRF及8个对比模型,各模型侧重不同的特征提取方式和上下文信息捕捉能力。
BiLSTM-CRF、RBC、BIC、RIC、DSKE-BiLSTM[16]、LS-BERT[17]及MLDF[18]均是基于序列标注的方法。BiLSTM-CRF和RBC侧重于序列标注和词对关系的简单捕捉,BIC和RIC侧重于通过增强上下文交互和长距离依赖处理。DSKE-BiLSTM在序列标注方法的基础上结合领域知识,提升了特定领域内的实体识别效果,而LS-BERT通过改进BERT预训练模型,加强了对长距离依赖的捕获能力。MLDF模型则通过多层动态融合不同层次的特征信息,提供了更丰富的特征表达。另一方面,Lx-GP[19]是基于跨度的方法,通过结合词汇信息与GlobalPointer提升实体边界识别的准确性。相比之下,W2NER[6]作为SOTA模型,创新性地提出了词-词关系分类方案,替代了传统的序列标注和跨度方法,在处理复杂实体结构、嵌套实体和不连续实体时表现突出。
为验证本文提出的结合对抗训练的双通道特征融合模型在NER任务中的有效性,本节基于5个公开数据集涵盖了不同领域和类型的文本进行对比实验,能够有效地测试模型在各种应用场景下的鲁棒性和泛化能力,实验结果见表 2。
|
|
表 2 对比实验 Tab. 2 Comparison experiment |
从表 2可以看出,在规范的Resume数据集中,各模型表现良好,F1值均在90%以上。本文的RFBG模型以96.47%的准确率、97.01%的召回率和96.74%的F1值优于近年其他模型。这是因为双通道模块能同时捕捉局部和全局信息,加强了长距离依赖的捕获并丰富了上下文特征,从而提升了NER任务的精度。双通道模块中,TIME与MHA的结合确保了模型在复杂句法结构和长距离依赖上的灵活性和准确性。
为进一步验证RFBG的性能,模型还在Weibo、CMeEE、CLUENER2020和Video_music_book数据集上与其他模型对比。从表 2可知,RFBG在这4个数据集上均表现优秀。在面对使用BIOES细粒度标注的BiLSTM-CRF、RBC、BIC、RIC、DSKE-BiLSTM及MLDF模型时,RFBG也展现出较为明显的优势,说明其在复杂和多样化的数据集中仍能保持较高的识别性能。
对比同为跨度方法的Lx-GP模型,RFBG在Weibo和CMeEE数据集的F1值分别提升5.78个百分点和11.19个百分点,表明其在噪声大、含嵌套实体场景下优势明显。相比SOTA模型的W2NER,RFBG在5个数据集的F1值分别提高了0.09、4.79、3.03、0.25和2.22个百分点。
RFBG的优势不仅体现在Resume、CLUENER2020和Video_music_book数据集上,在噪声较大的Weibo和含嵌套实体的CMeEE数据集上仍表现出色。这得益于RoBERTa-wwm-ext在中文文本中的上下文嵌入能力、FGM方法增强的抗噪性、BiLSTM的信息捕捉能力以及双通道模块对复杂序列的处理能力。这样的结合使RFBG在多场景下能有效识别各种实体类型及边界。
2.4 消融实验为进一步验证RFBG模型中各个模块的有效性,本节将采用消融实验对粗粒度数据集Video_music_book和噪声较多的数据集Weibo进行消融实验,同时可以探究各模块在不同类型数据集中的影响力,如表 3所示。
|
|
表 3 消融实验 Tab. 3 Ablation experiment |
以下是对消融实验中去除模块的简要说明:-FGM表示去除了添加在嵌入层后的对抗训练模块;-MHA表示去除了双通道模块中的多头注意力机制;-TIME表示去除了双通道模块中的时间步模块;-MT表示去除了整个双通道模块;-BiLSTM表示去除了在RFBG模型中的双向长短期记忆网络;-RoPE表示去除了GlobalPointer中的旋转位置编码。
从表 3可以看出,去除任一模块都会导致模型性能下降。对抗训练有助于提升模型的鲁棒性,使其对抗抖动和噪声具备更好的稳定性;去除FGM后,模型更易受输入扰动影响。在双通道模块中,MHA有效捕捉复杂和长距离依赖,去除MHA降低了模型捕捉分散信息的能力。TIME模块帮助模型理解词语的局部语义信息,去除后则影响实体识别的准确性。去除MT模块使模型对局部和全局信息的捕捉明显下降。去除BiLSTM导致模型丢失较多上下文信息,削弱了复杂特征的表示。去除解码器中的RoPE则使模型难以区分不同位置的词,位置编码有助于捕捉相邻词的关系,特别在噪声较大的Weibo数据集中,位置信息对识别特定实体类型更为重要。因此,去除RoPE对Weibo数据集的影响比对Video_music_book更明显。
2.5 参数敏感性分析在本节的参数敏感性分析实验中,采用逐一变动单个参数、固定其他参数的策略,以准确评估单一参数的影响。在学习率(lr)实验中,将批次数量固定为16,优化器设为Adam,以兼顾模型收敛稳定性与计算资源需求。在批次数量实验中,固定学习率为2e-5,优化器为Adam,以探讨批次数量对模型收敛的影响。在优化器实验中,固定学习率为2e-5,批次数量为16,确保优化器对比在稳定的学习率和批次数量时进行,减少其他参数的干扰,如图 3所示。
|
图 3 参数敏感性实验 Fig. 3 Parameter sensitivity experiments |
由图 3(a)可以看出,在学习率为2e-5时,RFBG模型在4个数据集上效果稳定。Resume和CLUENER2020数据集在所有学习率下的F1分数表现均较为稳定,尤其在2e-5时效果最佳;CMeEE和Weibo数据集对学习率更加敏感,随着学习率降低,F1分数也出现了下降的趋势。这表明对Resume和CLUENER2020数据集,模型对学习率的依赖较小,说明这些数据集更容易拟合;而CMeEE和Weibo数据集则需要较大的学习率来保证模型的良好性能,较小的学习率导致模型收敛较慢,甚至无法跳出局部最优。
在图 3(b)中,批次数量为16时,RFBG在大部分数据集上的性能达到最优。这是因为较大的批次数量可以为各数据集带来更稳定的梯度估计和更好的泛化性能,而Resume、CMeEE和CLUENER2020数据集在较小的批次数量下也能保持稳定的性能,说明这些数据集对梯度噪声的敏感性较低。
在图 3(c)的优化器选择实验中,4个数据集在Adam和RMSprop优化器下表现优异,并且在Adam优化器中F1值达到最优,这进一步证明了Adam的自适应特性在处理非平稳梯度时的优势。各数据集在SGD优化器下F1分数明显下降,尤其是Weibo和CMeEE的下降最为显著,这是因为这些数据集需要更稳定的自适应学习率来应对复杂的特征分布,而SGD的固定学习率和较大的波动性不适合这些任务,Resume和CLUENER2020数据集则对优化器的敏感度较低,Adam和SGD的差异不如前两个数据集显著。
3 结语本文提出了一种结合对抗训练的双通道特征融合的命名实体识别模型。该模型采用RoBERTa-wwm-ext作为预训练模型,结合其全词掩码策略,能够准确地适应中文文本的特性。同时,引入的对抗训练方法使模型不仅提高了应对外部干扰的鲁棒性,而且加深了对训练数据的理解和泛化能力。此外,在BiLSTM的基础上,集成多头注意力和时间步的双通道模块,使模型能够更加精准地提取和解析文本中的语义信息。最后,使用GlobalPointer解码提高了模型对粗细粒度实体的识别能力。实验证明,本文提出的模型与其他模型相比展示出了较好的性能,并且具有良好的适应性和泛化能力。
由于FGM过于激进的扰动策略,可能使模型的扰动过大。在未来工作中,可以尝试增加约束条件或限制扰动范围从而避免过大的扰动以进一步提升模型的性能。
| [1] |
HOSSAIN M S, NAYLA N, RASSEL A A. Product market demand analysis using NLP in Banglish text with sentiment analysis and named entity recognition[C]//2022 56th Annual Conference on Information Sciences and Systems. Piscataway: IEEE Press, 2022: 166-171.
( 0) |
| [2] |
NASSIRI K, AKHLOUFI M. Transformer models used for text-based question answering systems[J]. Applied intelligence, 2023, 53(9): 10602-10635. DOI:10.1007/s10489-022-04052-8 ( 0) |
| [3] |
ABDOUN N, CHAMI M. Automatic text classification of PDF documents using NLP techniques[J]. INCOSE international symposium, 2022, 32(1): 1320-1331. DOI:10.1002/iis2.12997 ( 0) |
| [4] |
SCHÄFER H, IDRISSI-YAGHIR A, HORN P, et al. Cross-language transfer of high-quality annotations: combining neural machine translation with cross-linguistic span alignment to apply NER to clinical texts in a low-resource language[C]//Proceedings of the 4th Clinical Natural Language Processing Workshop. Stroudsburg: Association for Computational Linguistics, 2022: 53-62.
( 0) |
| [5] |
WESTON L, TSHITOYAN V, DAGDELEN J, et al. Named entity recognition and normalization applied to large-scale information extraction from the materials science literature[J]. Journal of chemical information and modeling, 2019, 59(9): 3692-3702. DOI:10.1021/acs.jcim.9b00470 ( 0) |
| [6] |
LI J Y, FEI H, LIU J, et al. Unified named entity recognition as word-word relation classification[C]// Proceedings of the AAAI Conference on Artificial Intelligence. Palo Alto: AAAI Press, 2022: 10965-10973.
( 0) |
| [7] |
李明键, 李卫军, 王海荣. 融合关联信息与CNN的实体识别研究[J]. 郑州大学学报(理学版), 2023, 55(5): 53-59. LI M J, LI W J, WANG H R. Research on entity recognition based on related information and CNN[J]. Journal of Zhengzhou university (natural science edition), 2023, 55(5): 53-59. ( 0) |
| [8] |
ZHANG Y N, CHEN Q C. A neural span-based continual named entity recognition model[C]// Proceedings of the AAAI Conference on Artificial Intelligence. Palo Alto: AAAI Press, 2023: 13993-14001.
( 0) |
| [9] |
CUI Y M, CHE W X, LIU T, et al. Pre-training with whole word masking for Chinese BERT[J]. IEEE/ACM transactions on audio, speech, and language processing, 2021, 29: 3504-3514. DOI:10.1109/TASLP.2021.3124365 ( 0) |
| [10] |
DEVLIN J, CHANG M W, LEE K, et al. BERT: pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Cambridge: MIT Press, 2019: 4171-4186.
( 0) |
| [11] |
VASWANI A, SHAZEER N, PARMAR N, et al. Attention is all you need[EB/OL]. (2023-08-02)[2024-07-05]. https://doi.org/10.48550/arXiv.1706.03762.
( 0) |
| [12] |
MIYATO T, DAI A M, GOODFELLOW I. Adversarial training methods for semi-supervised text classification[EB/OL]. (2016-05-25)[2024-07-16]. https://arxiv.org/abs/1605.07725v4.
( 0) |
| [13] |
MADRY A, MAKELOV A, SCHMIDT L, et al. Towards deep learning models resistant to adversarial attacks[EB/OL]. (2019-09-04)[2024-07-19]. https://arxiv.org/abs/1706.06083v4.
( 0) |
| [14] |
GOODFELLOW I J, SHLENS J, SZEGEDY C, et al. Explaining and harnessing adversarial examples[EB/OL]. (2015-03-20)[2024-07-17]. https://arxiv.org/abs/1412.6572v3.
( 0) |
| [15] |
SU J L, MURTADHA A, PAN S F, et al. Global pointer: novel efficient span-based approach for named entity recognition[EB/OL]. (2022-08-05)[2024-07-19]. https://arxiv.org/abs/2208.03054v1.
( 0) |
| [16] |
WANG T B, HUANG R Y, HU N, et al. Chinese named entity recognition method based on dictionary semantic knowledge enhancement[J]. IEICE transactions on information and systems, 2023, 106(5): 1010-1017. ( 0) |
| [17] |
SHAO Q, XIAO B, CHEN Q, et al. Chinese name entity recognition with label semantics[C]//IEEE International Conference on Network Intelligence and Digital Content. Piscataway: IEEE Press, 2023: 1-5.
( 0) |
| [18] |
林令德, 刘纳, 徐贞顺, 等. 基于多层动态融合的中文医疗命名实体识别[J]. 计算机工程与应用, 2024, 60(15): 161-169. LIN L D, LIU N, XU Z S, et al. Chinese medical named entity recognition based on multi-layer dynamic fusion[J]. Computer engineering and applications, 2024, 60(15): 161-169. ( 0) |
| [19] |
李明键, 李卫军, 王海荣. 融合词汇信息与GlobalPointer的实体识别[J]. 山东大学学报(工学版), 2024, 54(1): 91-99. LI M J, LI W J, WANG H R. Entity recognition based on lexicon information and GlobalPointer[J]. Journal of Shandong university (engineering science), 2024, 54(1): 91-99. ( 0) |
2026, Vol. 58



0)