<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005">
<channel xmlns:cfi="http://www.microsoft.com/schemas/rss/core/2005/internal" cfi:lastdownloaderror="None">
<title cf:type="text"><![CDATA[广西科学 -->自然语言理解]]></title>
<item>
<title xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="text"><![CDATA[基于机器阅读理解的中文司法实体识别优化策略研究]]></title>
<link><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230103&flag=1]]></link>
<description xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="html"><![CDATA[针对中文司法领域信息抽取数据集中实体专业性较强、现有机器阅读理解(MRC)模型无法通过构建问句提供充足的标签语义且在噪声样本上表现不佳等问题，本研究提出了一种联合优化策略。首先，通过聚合在司法语料中多次出现的实体构建司法领域词典，将专业性较强的实体知识注入RoBERTa-wwm预训练语言模型进行预训练。然后，通过基于自注意力机制来区分每个字对不同标签词的重要性，从而将实体标签语义融合到句子表示中。最后，在微调阶段采用对抗训练算法对模型进行优化，增强模型的鲁棒性和泛化能力。在2021年中国法律智能评测(CAIL2021)司法信息抽取数据集上的实验结果表明：相较于基线模型，本研究方法<i>F1</i>值提高了2.79%，并且模型在CAIL2021司法信息抽取赛道中获得了全国三等奖的成绩，验证了联合优化策略的有效性。]]></description>
<pubDate>2023/3/24 20:55:36</pubDate>
<category><![CDATA[自然语言理解]]></category>
<author><![CDATA[余俊晖，陈艳平，秦永彬，黄辉]]></author>
<guid><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230103&flag=1]]></guid><cfi:id>5</cfi:id><cfi:read>true</cfi:read></item>
<item>
<title xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="text"><![CDATA[CCM-MF:基于多维度特征融合的中文文本分类模型]]></title>
<link><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230104&flag=1]]></link>
<description xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="html"><![CDATA[针对中文文本中不同维度特征所携带的语义信息具有差异性的问题，本文提出一种基于多维度特征融合的中文文本分类模型：CCM-MF (Chinese-text Classification Model Based on Fused Multi-dimensional Features)。该模型融合层次维度和空间维度特征，以提高中文文本分类的准确率。首先，在层次维度上，使用预训练模型ERNIE (Enhanced Representation through Knowledge Integration)获取包含字、词及实体级别特征的词向量；然后，在空间维度上，将包含层次维度特征的词向量分别输入到改进后的深度金字塔卷积神经网络(Deep Pyramid Convolutional Neural Networks，DPCNN)模型及附加注意力机制的双向长短期记忆网络(Attention-Based Bidirectional Long Short-Term Memory Networks，Att-BLSTM)模型中，得到局部语义特征和全局语义特征；最后，将得到的空间维度特征分别作用于Softmax分类器，再对计算结果进行融合并输出分类结果。通过在多个公开数据集上进行实验，较现有主流的文本分类方法，本模型在准确率上有更好的表现，证明了该模型的有效性。]]></description>
<pubDate>2023/3/24 20:55:36</pubDate>
<category><![CDATA[自然语言理解]]></category>
<author><![CDATA[马子晨，张顺香，刘云朵，王星光，张友强]]></author>
<guid><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230104&flag=1]]></guid><cfi:id>4</cfi:id><cfi:read>true</cfi:read></item>
<item>
<title xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="text"><![CDATA[基于BERT的危险化学品命名实体识别模型]]></title>
<link><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230105&flag=1]]></link>
<description xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="html"><![CDATA[针对危险化学品实体识别及关系识别的问题，本文基于双向长短期记忆网络连接条件随机场(Bidirectional Long Short-Term Memory with Conditional Random Field，BiLSTM-CRF)模型，通过引入双向编码器表示(Bidirectional Encoder Representation from Transformers，BERT)模型结合多头自注意力机制，提出了一种预训练命名实体模型BERT-BiLSTM-self-Attention-CRF，通过对危险化学品的文本进行字符级别编码，得到基于上下文信息的字向量，增强了模型挖掘文本全局和局部特征的能力。实验结果表明，在自行构建的数据集上，本文模型优于其他传统模型，其<i>F1</i>值为94.57%。]]></description>
<pubDate>2023/3/24 20:55:37</pubDate>
<category><![CDATA[自然语言理解]]></category>
<author><![CDATA[陈观林，程钊，邹凌，杨武剑，李甜]]></author>
<guid><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230105&flag=1]]></guid><cfi:id>3</cfi:id><cfi:read>true</cfi:read></item>
<item>
<title xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="text"><![CDATA[大词汇量环境噪声下的多模态视听语音识别方法]]></title>
<link><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230106&flag=1]]></link>
<description xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="html"><![CDATA[视听语音识别(Audio-Visual Speech Recognition,AVSR)技术利用唇读和语音识别(Audio-Visual Speech Recognition,AVSR)的关联性和互补性可有效提高字符识别准确率。针对唇读的识别率远低于语音识别、语音信号易受噪声破坏、现有的视听语音识别方法在大词汇量环境噪声中的识别率大幅降低等问题，本文提出一种多模态视听语音识别(Multi-modality Audio-Visual Speech Recognition,MAVSR)方法。该方法基于自注意力机制构建双流前端编码模型，引入模态控制器解决环境噪声下音频模态占据主导地位而导致的各模态识别性能不均衡问题，提高识别稳定性与鲁棒性，构建基于一维卷积的多模态特征融合网络，解决音视频数据异构问题，提升音视频模态间的关联性与互补性。与现有主流方法对比，在仅音频、仅视频、音视频融合3种任务下，该方法的识别准确率提升7.58%以上。]]></description>
<pubDate>2023/3/24 20:55:37</pubDate>
<category><![CDATA[自然语言理解]]></category>
<author><![CDATA[吴兰，杨攀，李斌全，王涵]]></author>
<guid><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230106&flag=1]]></guid><cfi:id>2</cfi:id><cfi:read>true</cfi:read></item>
<item>
<title xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="text"><![CDATA[融合生成式模型的知识增强实体链指方法]]></title>
<link><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230107&flag=1]]></link>
<description xmlns:cf="http://www.microsoft.com/schemas/rss/core/2005" cf:type="html"><![CDATA[未链接实体分类是实体链指(Entity Linking,EL)任务中的重要研究内容之一。现有方法存在上下文语义信息不充分、分类准确率低等问题，导致实体链指任务表现不佳。本研究提出一种融合生成式模型的知识增强实体链指方法。该方法将实体链指分为两个子模块，即候选实体排序模块和未链接实体分类模块。本研究基于高精度的候选实体排序模块，获得高质量的知识扩展信息，并对未链接实体分类任务进行知识增强；针对未链指实体提及的分类问题，提出一套生成式框架，该框架能够取得超过基线模型的性能。本研究方法在2020年全国知识图谱与语义计算大会(CCKS2020)评测任务二的中文短文本实体链指数据集上取得了目前最佳性能(整体<i>F</i>值为91.76%)，证明知识增强和生成式框架的引入能提高模型的泛化能力，缓解未链接实体分类中的信息不充分问题。]]></description>
<pubDate>2023/3/24 20:55:37</pubDate>
<category><![CDATA[自然语言理解]]></category>
<author><![CDATA[乔胤博，杨志豪，林鸿飞]]></author>
<guid><![CDATA[http://gxkx.ijournal.cn/gxkx/ch/reader/view_abstract.aspx?file_no=20230107&flag=1]]></guid><cfi:id>1</cfi:id><cfi:read>true</cfi:read></item>
</channel>
</rss>