|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 自然语言处理预训练模型的研究综述显示文摘近年来,深度学习技术被广泛应用于各个领域,基于深度学习的预处理模型将自然语言处理带入一个新时代。预训练模型的目标是如何使预训练好的模型处于良好的初始状态,在下游任务中达到更好的性能表现。对预训练技术及其发展历史进行介绍,并按照模型特点划分为基于概率统计的传统模型和基于深度学习的新式模型进行综述;简要分析传统预训练模型的特点及局限性,重点介绍基于深度学习的预训练模型,并针对它们在下游任务的表现进行对比评估;梳理出具有启发意义的新式预训练模型,简述这些模型的改进机制以及在下游任务中取得的性能提升;总结目前预训练的模型所面临的问题,并对后续发展趋势进行展望。 | 余同瑞 金冉 韩晓臻 李家辉 郁婷 | 2020 | 计算机工程与应用2020,56,23: | 39 |
| 2 | SikuBERT与SikuRoBERTa:面向数字人文的《四库全书》预训练模型构建及应用研究显示文摘数字人文研究需要大规模语料库和高性能古文自然语言处理工具的支持。面向英语和现代汉语的预训练语言模型已在相关领域提升了文本挖掘精度,数字人文研究的兴起亟须面向古文自动处理领域的预训练模型。文章以校验后的高质量《四库全书》全文语料作为无监督训练集,基于BERT模型框架,构建面向古文智能处理任务的SikuBERT和SikuRoBERTa预训练语言模型。实验进一步设计面向《左传》语料的古文自动分词、断句标点、词性标注和命名实体识别等验证任务,分别对SikuBERT、SikuRoBERTa预训练模型和其他3种基线模型(BERT-base、RoBERTa、GuwenBERT)进行对比试验。结果显示:SikuBERT和SikuRoBERTa模型在全部4个下游验证任务中的表现均超越其他基线预训练模型,表明文章提出的预训练模型具有较强的古文词法、句法、语境学习能力和泛化能力。基于验证任务效果最优的SikuRoBERTa预训练模型,进一步构建“SIKUBERT典籍智能处理平台”。该平台提供典籍自动处理、检索和自动翻译等在线服务,可以辅助哲学、文学、历史学等领域学者在不具备数据挖掘与深度学习的专业背景下,以直观可视化方式对典籍文本进行高效率、多维度、深层次、细粒化的知识挖掘与分析。 | 王东波 刘畅 朱子赫 刘江峰 胡昊天 沈思 李斌 | 2022 | 图书馆论坛2022,42,6: | 34 |
| 3 | 自然语言处理预训练技术综述显示文摘在目前已发表的自然语言处理预训练技术综述中,大多数文章仅介绍神经网络预训练技术或者极简单介绍传统预训练技术,存在人为割裂自然语言预训练发展历程。为此,以自然语言预训练发展历程为主线,从以下四方面展开工作:首先,依据预训练技术更新路线,介绍了传统自然语言预训练技术与神经网络预训练技术,并对相关技术特点进行分析、比较,从中归纳出自然语言处理技术的发展脉络与趋势;其次,主要从两方面介绍了基于BERT改进的自然语言处理模型,并对这些模型从预训练机制、优缺点、性能等方面进行总结;再者,对自然语言处理的主要应用领域发展进行了介绍,并阐述了自然语言处理目前面临的挑战与相应解决办法;最后,总结工作,预测了自然语言处理的未来发展方向。旨在帮助科研工作者更全面地了解自然语言预训练技术发展历程,继而为新模型、新预训练方法的提出提供一定思路。 | 陈德光 马金林 马自萍 周洁 | 2021 | 计算机科学与探索2021,15,8: | 27 |
| 4 | 多标签文本分类研究进展显示文摘文本分类作为自然语言处理中一个基本任务,在20世纪50年代就已经对其算法进行了研究,现在单标签文本分类算法已经趋向成熟,但是对于多标签文本分类的研究还有很大的提升空间。介绍了多标签文本分类的基本概念以及基本流程,包括数据集获取、文本预处理、模型训练和预测结果。介绍了多标签文本分类的方法。这些方法主要分为两大类:传统机器学习方法和基于深度学习的方法。传统机器学习方法主要包括问题转换方法和算法自适应方法。基于深度学习的方法是利用各种神经网络模型来处理多标签文本分类问题,根据模型结构,将其分为基于CNN结构、基于RNN结构和基于Transformer结构的多标签文本分类方法。对多标签文本分类常用的数据集进行了梳理总结。对未来的发展趋势进行了分析与展望。 | 郝超 裘杭萍 孙毅 张超然 | 2021 | 计算机工程与应用2021,57,10: | 22 |
| 5 | 融合多层注意力的方面级情感分析模型显示文摘方面情感分析旨在分析给定文本中特定方面的情感极性。针对目前的研究方法存在对方面情感注意力引入不足问题,提出了一种融合BERT和多层注意力的方面级情感分类模型(BERTandMulti-LayerAttention,BMLA)。模型首先提取BERT内部多层方面情感注意力信息,将编码后的方面信息与BERT隐藏层表征向量融合设计了多层方面注意力,然后将多层方面注意力与编码输出文本进行级联,进而增强了句子与方面词之间的长依赖关系。在SemEval2014 Task4和AIChallenger 2018数据集上的实验表明,强化目标方面权重并在上下文进行交互对方面情感分类是有效的。 | 袁勋 刘蓉 刘明 | 2021 | 计算机工程与应用2021,57,22: | 9 |
| 6 | 自然语言处理新范式:基于预训练模型的方法显示文摘以BERT和GPT为代表的、基于超大规模文本数据的预训练语言模型能够充分利用大模型、大数据和大计算,使几乎所有自然语言处理任务性能都得到显著提升,在一些数据集上达到甚至超过人类水平,已成为自然语言处理的新范式。认为未来自然语言处理,乃至整个人工智能领域,将沿着“同质化”和“规模化”的道路继续前进,并将融入多模态数据、具身行为数据、社会交互数据等更多的“知识”源,从而为实现真正的通用人工智能铺平道路。 | 车万翔 刘挺 | 2022 | 中兴通讯技术2022,28,2: | 9 |
| 7 | 面向数字人文的《四库全书》子部自动分类研究——以SikuBERT和SikuRoBERTa预训练模型为例显示文摘文章基于面向古文自然语言处理的SikuBERT和SikuRoBERTa预训练语言模型,在《四库全书》子部14个类别的古籍文本上开展典籍自动分类模型的构建,并与BERT、BERT-wwm、RoBERTa和RoBERTa-wwm基线模型进行对比。文章提出的两种分类模型效果均优于基线模型,SikuBERT模型取得90.39%的整体分类F值,在天文算法类古籍上的分类F值达98.83%。在类别自动识别任务中,SikuRoBERTa的预测正确率达95.30%。基于SikuBERT和SikuRoBERTa预训练语言模型的四库自动分类体系可以将典籍文本划分为所属子部类别,构建的分类工具为高效自动化典籍分类提供了新途径。 | 胡昊天 张逸勤 邓三鸿 王东波 冯敏萱 刘浏 李斌 | 2022 | 图书馆论坛2022,42,12: | 8 |
| 8 | 自然语言预训练模型知识增强方法综述显示文摘将知识引入到依靠数据驱动的人工智能模型中是实现人机混合智能的一种重要途径。当前以BERT为代表的预训练模型在自然语言处理领域取得了显著的成功,但是由于预训练模型大多是在大规模非结构化的语料数据上训练出来的,因此可以通过引入外部知识在一定程度上弥补其在确定性和可解释性上的缺陷。该文针对预训练词嵌入和预训练上下文编码器两个预训练模型的发展阶段,分析了它们的特点和缺陷,阐述了知识增强的相关概念,提出了预训练词嵌入知识增强的分类方法,将其分为四类:词嵌入改造、层次化编解码过程、优化注意力和引入知识记忆。将预训练上下文编码器的知识增强方法分为任务特定和任务通用两大类,并根据引入知识的显隐性对其中任务通用的知识增强方法进行了进一步的细分。该文通过分析预训练模型知识增强方法的类型和特点,为实现人机混合的人工智能提供了模式和算法上的参考依据。 | 孙毅 裘杭萍 郑雨 张超然 郝超 | 2021 | 中文信息学报2021,35,7: | 8 |
| 9 | 基于MacBERT-BiLSTM-CRF的反恐领域细粒度实体识别显示文摘为验证基于深度学习的命名实体识别框架在反恐领域的有效性,参照ACE 2005实体标注规范,制订了细粒度反恐实体标签体系,构建了反恐实体语料集Anti-Terr-Corpus;提出基于MacBERT-BiLSTM-CRF的实体识别模型,通过能减少预训练和微调阶段差异的MacBERT(masked language modeling as correction bidirectional encoder representations from transformers)预训练语言模型获得动态字向量表达,送入双向长短时记忆(bidirectional long short-term memory,BiLSTM)和条件随机场(conditional random field,CRF)进行上下文特征编码和解码得到最佳实体标签;替换框架中的预训练语言模型进行对比实验。实验表明该模型可以有效获取反恐新闻中的重要实体。对比BiLSTM-CRF模型,MacBERT的加入提高了24.5%的F1值;保持编码-解码层为BiLSTM-CRF时,加入MacBERT比加入ALBERT(a lite BERT)提高了5.1%的F1值。可见,深度学习有利于反恐领域实体识别,能够利用公开反恐新闻文本为后续反恐形势预判服务,同时有助于反恐领域信息提取、知识图谱构建等基础性任务。 | 焦凯楠 李欣 叶瀚 朱容辰 孙海春 | 2021 | 科学技术与工程2021,21,29: | 6 |
| 10 | 基于BERT的端到端语音合成方法显示文摘针对基于RNN的神经网络语音合成模型训练和预测效率低下以及长距离信息丢失的问题,提出了一种基于BERT的端到端语音合成方法,在语音合成的Seq2Seq架构中使用自注意力机制(Self-Attention Mechanism)取代RNN作为编码器。该方法使用预训练好的BERT作为模型的编码器(Encoder)从输入的文本内容中提取上下文信息,解码器(Decoder)采用与语音合成模型Tacotron2相同的架构输出梅尔频谱,最后使用训练好的WaveGlow网络将梅尔频谱转化为最终的音频结果。该方法在预训练BERT的基础上通过微调适配下游任务来大幅度减少训练参数和训练时间。同时,借助其自注意力(Self-Attention)机制还可以并行计算编码器中的隐藏状态,从而充分利用GPU的并行计算能力以提高训练效率,并能有效缓解远程依赖问题。与Tacotron2模型的对比实验表明,文中提出的模型能够在得到与Tacotron2模型相近效果的基础上,把训练速度提升1倍左右。 | 安鑫 代子彪 李阳 孙晓 任福继 | 2022 | 计算机科学2022,49,4: | 5 |
| 11 | 基于ALBERT模型的园林植物知识实体与关系抽取方法显示文摘园林植物知识图谱可为顾及区域适应性、观赏性和生态性等因子的绿化树种的选型提供知识支持。植物描述文本的实体识别及关系抽取是知识图谱构建的关键环节。针对植物领域未有公开的标注数据集,本文阐述了园林植物数据集的构建流程,定义了园林植物的概念体系结构,完成了园林植物语料库的构建。针对现有Word2vec、ELMo和BERT等语言模型存在无法解决多义词、融合上下文能力差、运行速度慢等缺点,提出了嵌入ALBERT(A Lite BERT)预训练语言模型的实体识别和关系抽取模型。ALBERT预训练的动态词向量能够有效地表示文本特征,将其分别输入到BiGRU-CRF命名实体识别模型和BiGRU-Attention关系抽取模型中进行训练,进一步提升实体识别和关系抽取的效果。在园林植物语料库上进行方法的有效性验证,结果表明ALBERT-BiGRU-CRF命名实体识别模型的F1值为0.9517,ALBERT-BiGRU-Attention关系抽取模型的F1值为0.9161,相较于经典的语言模型(如Word2vec、ELMo和BERT等)性能有较为显著的提升。因此基于ALBERT模型的实体与关系抽取任务能有效提高识别分类效果,可将其应用于植物描述文本的实体关系抽取任务中,为园林植物知识图谱自动构建提供方法。 | 陈晓玲 唐丽玉 胡颖 江锋 彭巍 冯先超 | 2021 | 地球信息科学学报2021,23,7: | 5 |
| 12 | 基于Transformer的自然语言处理预训练语言模型概述显示文摘在自然语言处理领域,谷歌提出Transformer模型之后,以生成式预训练模型(Generative Pre-Training,GPT)和深度双向预训练语言模型(Bidirectional Encoder Representat ions from Transformers,BERT)等为代表的一些基于Transformer的预训练语言模型(Transformer-based Pre-trained Language Models,TPLM)相继被提出,在大部分自然语言处理任务上取得很好的效果。TPLM使用自监督学习方法学习来自大量文本数据的通用语言表示,并将这些知识转移到下游任务中,为其提供了背景知识,避免了重新开始训练新任务模型的情况。笔者主要研究了基于Transformer的预训练语言模型与基于TPLM的“预训练+微调”的自然语言处理预训练新技术模式。首先,介绍预训练模型的发展背景;其次,解释各种有关TPLM的核心概念,如预训练、预训练方法、预训练任务、自监督学习与迁移学习等;再次,简要介绍相关TPLM模型与目前的进展;最后,提出改进TPLM的方法并总结。 | 史童月 王中卿 | 2022 | 信息与电脑2022,34,10: | 5 |
| 13 | 深度学习驱动的海量人文社会科学学术文献学科分类研究显示文摘[目的/意义]探索不同社会科学学科间差异,支持学科建设、科技检索服务,进一步完善文献学科的分类体系。[方法/过程]基于多种深度学习模型和预训练语言模型构建社会科学文献学科分类器,利用CSSCI目录中的20多个一级学科中近350万篇文献构成的数据集进行实验;利用Sentence-BERT输出摘要句子向量并进行层次聚类,根据聚类结果划分学科组,并计算模型对于不同学科组的分类性能以缓和学科交叉的影响;利用模糊准确性指标输出模型对每条记录输出的前N个高概率学科以弥补原有学科分类的局限性。[结果/结论]在“摘要+标题”上使用深度预训练语言模型取得最佳性能;基于层次聚类所得的学科组进行的分类较单一学科性能有所提升;模型的模糊准确性在N=3时能够达到96%。[局限]未考虑从全文文本上获取更丰富的文献学科特征进行自动分类。 | 刘江峰 林立涛 刘畅 何洪旭 吴娜 沈思 王东波 | 2023 | 情报理论与实践2023,46,2: | 5 |
| 14 | 图深度学习技术在电力系统分析与决策领域的应用与展望显示文摘新型电力系统的高比例可再生能源、高比例电力电子设备特性给电力系统分析与决策带来巨大挑战。以深度学习(deep learning,DL)为代表的数据驱动技术擅长应对大规模高维非线性数据建模问题,在电力系统分析与决策的应用愈发受到业界的关注。作为近年来的热门分支之一,图深度学习(graph deep learning,GDL)将DL技术拓展到了不规则拓扑关联数据的处理,加快DL技术实用化的步伐。该文对电力系统分析与决策各领域的任务需求、DL应用现状做了简要归纳,结合GDL的发展脉络与前沿热点技术,全面总结GDL在电力系统分析与决策应用优势与不足,围绕通用性/迁移性、可靠性以及可解释性等方面探讨GDL框架的未来发展思路。 | 管霖 黄济宇 蔡锱涵 朱思婷 | 2022 | 高电压技术2022,48,9: | 5 |
| 15 | 基于BERT-BiLSTM-CRF的中文地址解析方法显示文摘中文地址解析是地址匹配的重要环节,广泛应用于地址检索、地理编码和地址信息识别等方面。但传统地址解析方法存在覆盖度有限、人工参与过多和泛化能力较差等问题。为发挥深度学习模型在深层结构上自动学习上下文特征的优势,提出一种基于BERT-BiLSTM-CRF深度学习模型的中文地址解析方法:依据中文地址要素多级分类体系,扩展BIOES标注方法并进行地址语料标注;基于预训练语言模型,构建融合BERT、BiLSTM和CRF的综合深度学习模型,通过BERT预训练语言模型获取富含语义信息的字符向量,弥补静态词向量特异性缺失的问题,提高复杂地址要素的提取能力。以2019年深圳市地址数据为例进行模型性能评估,该方法对于多数中文地址要素的解析准确率达90%以上;相比IDCNN-CRF和BiLSTM-CRF等深度学习模型,该方法对只具有小规模地址语料时的地址解析效果更优,且在解析多种地址要素类型时能保持良好的性能。 | 吴恪涵 张雪英 叶鹏 怀安 张航 | 2021 | 地理与地理信息科学2021,37,4: | 4 |
| 16 | 面向古籍数字人文的《资治通鉴》自动摘要研究——以SikuBERT预训练模型为例显示文摘能降低信息获取成本,对篇幅长而句子短、文字理解门槛高的古籍文献而言尤其必要,但针对古文的自动摘要研究很少。文章面向《资治通鉴》语料,基于SikuBERT预训练模型进行自动摘要实验,并对比其与传统抽取式自动摘要算法和百度智能云摘要分析算法在《资治通鉴》语料上的表现。实验结果表明:基于SikuBERT预训练模型生成的摘要结果在稳定性、覆盖度等方面较好;通过专家人工打分方式,基于SikuBERT预训练模型生成的摘要结果平均得分最高。实验验证了使用数字人文技术对古文进行自动摘要任务的可行性和利用SikuBERT预训练模型对古文进行信息处理的适用性。 | 徐润华 王东波 刘欢 梁媛 陈康 | 2022 | 图书馆论坛2022,42,12: | 4 |
| 17 | 作物病害智能诊断与处方推荐技术研究进展显示文摘由“植物诊所”形成的电子病历为作物病害处方推荐提供了新的思路。如何高效地挖掘电子病历数据并辅助作物病害处方推荐,目前还是亟待解决的研究热点问题。在总结和整理现有国内外研究文献的基础上,对基于显微图像的作物病害病菌孢子识别、基于光谱的作物病害诊断、基于电子病历的作物病害处方推荐等作物病害诊断与处方推荐关键技术进行了系统分析与讨论。综述结果表明,围绕作物病害病菌侵染过程,以智能化处方推荐需求为导向,开展基于电子病历数据挖掘的作物病害处方推荐研究,将成为一个研究重点。针对作物病害处方推荐过程中,存在由于作物病害致病机理复杂、作物品种及病害种类多、病害病症动态变化且特征多等特点和难点,研究基于电子病历数据挖掘的作物病害致病机理解析、诊断推理、智能化处方推荐及其应用策略,将是研究的重大方向;探索基于知识图谱分析、大数据挖掘和机器学习算法推理等关键技术的作物病害电子病历数据挖掘分析研究,从区域宏观视角可视化解析作物病害致病机理及其与特征间的关联关系,面向实际应用场景实现基于诊断推理的单一作物病害处方推荐、基于语义匹配的多种作物多种病害处方推荐,具有更大的实际意义。 | 张领先 韩梦瑶 丁俊琦 李凯雨 | 2023 | 农业机械学报2023,54,6: | 4 |
| 18 | 结合上下文和依存句法信息的中文短文本情感分析显示文摘依存句法分析旨在从语言学的角度分析句子的句法结构。现有的研究表明,将这种类似于图结构的数据与图卷积神经网络(Graph Convolutional Network,GCN)进行结合,有助于模型更好地理解文本语义。然而,这些工作在将依存句法信息处理为邻接矩阵时,均忽略了句法依赖标签类型,同时也未考虑与依赖标签相关的单词语义,导致模型无法捕捉到文本中的深层情感特征。针对以上问题,提出了一种结合上下文和依存句法信息的中文短文本情感分析模型(Context and Dependency Syntactic Information,CDSI)。该模型不仅利用双向长短期记忆网络(Bidirectional Long Short-Term Memory,BiLSTM)提取文本的上下文语义,而且引入了一种基于依存关系感知的嵌入表示方法,以针对句法结构挖掘不同依赖路径对情感分类任务的贡献权重,然后利用GCN针对上下文和依存句法信息同时建模,以加强文本表示中的情感特征。基于SWB,NLPCC2014和SMP2020-EWEC数据集进行验证,实验表明CDSI模型能够有效融合语句中的语义以及句法结构信息,在中文短文本情感二分类以及多分类中均取得了较好的效果。 | 杜启明 李男 刘文甫 杨舒丹 岳峰 | 2023 | 计算机科学2023,50,3: | 4 |
| 19 | 基于BERT的民间文学文本预训练模型显示文摘民间文学文本中含有大量生动形象的修辞手法;人名、地名极其复杂,难以判断词与词之间的边界;与现代汉语表达差别较大,预训练语言模型难以有效地学习其隐含知识,为机器自然语言理解带来困难。该文提出一种基于BERT的民间文学文本预训练模型MythBERT,使用民间文学语料库预训练,将BERT的字隐蔽策略改进为对中文词语隐蔽策略。对民间文学文本中解释字、词的注释词语重点隐蔽,减小BERT隐蔽的随机性并有利于学习词语语义信息。同时利用注释增强语言模型表示,解决一词多义、古今异义等问题。将MythBERT与BERT、BERT-WWM和RoBERTa等主流中文预训练模型在情感分析、语义相似度、命名实体识别和问答四个自然语言处理任务上进行比较。实验结果表明,注释增强的民间文学预训练模型MythBERT在民间文学文本任务上性能显著提升,与基线方法相比取得了最优的效果。 | 陶慧丹 段亮 王笳辉 岳昆 | 2022 | 计算机技术与发展2022,32,11: | 3 |
| 20 | 对比学习研究综述显示文摘由于传统的监督学习方法很大程度上依赖于大量的标注数据,近年来,无需外部监督信息的自监督学习方法受到了极大关注.对比学习是一种有效的自监督学习方法,它通过对比相似样本和不相似样本,使得模型能够学习到样本的重要内在特征,进而应用于下游任务,在计算机视觉和自然语言处理等领域得到了越来越广泛的应用.本文系统地梳理了对比学习研究现状.首先介绍了对比学习的起源和主要思想,然后归纳了对比学习在设计映射函数、正负例构造和损失函数构造等方面的研究动态,接着重点介绍了面向计算机视觉和自然语言处理的对比学习研究;最后,分析了现有研究存在的问题,探讨了对比学习未来的研究趋势和发展方向. | 李希 刘喜平 李旺才 万常选 刘德喜 | 2023 | 小型微型计算机系统2023,44,4: | 3 |