为解决水产医学命名实体识别中存在的嵌套实体识别准确率不高的问题,提出一种基于多核卷积的命名实体识别模型(BERT+Multi-CNN+CRF),采用多核卷积神经网络提取嵌套实体特征,通过BERT(bidirectional encoder representations from transf...为解决水产医学命名实体识别中存在的嵌套实体识别准确率不高的问题,提出一种基于多核卷积的命名实体识别模型(BERT+Multi-CNN+CRF),采用多核卷积神经网络提取嵌套实体特征,通过BERT(bidirectional encoder representations from transformers)方法对输入语料进行预训练,丰富嵌套实体位置向量信息,获得嵌套实体输入特征矩阵,将提取特征矩阵与输入特征矩阵融合,以增强嵌套实体的特征表示,并进行不同模型的对比试验。结果表明,本文中提出的BERT+Multi-CNN+CRF模型,在水产医学嵌套命名实体识别任务中的准确率、召回率和F1值分别为88.04%、88.92%和88.48%,与识别准确率较高的BERT+BiLSTM+ATT+CRF模型相比,分别提高了2.25%、3.23%和2.74%。研究表明,本文中提出的BERT+Multi-CNN+CRF模型可有效解决水产医学嵌套实体识别准确率不高的问题,是一种有效的水产医学嵌套命名实体识别方法。展开更多
为解决渔业标准命名实体识别任务中部分实体语料分布稀疏导致的效果不佳问题,提出了基于多元组合数据增广(data augmentation method based on multiple combination,MCA)的渔业标准命名实体识别方法,该方法融合了基于领域词典的联合替...为解决渔业标准命名实体识别任务中部分实体语料分布稀疏导致的效果不佳问题,提出了基于多元组合数据增广(data augmentation method based on multiple combination,MCA)的渔业标准命名实体识别方法,该方法融合了基于领域词典的联合替换算法(joint replacement algorithm based on domain dictionary,DDR)、基于槽点保护的随机删除算法(random deletion algorithm based on slot protection,SPD)和基于槽点保护的随机插入算法(random insertion algorithm based on slot protection,SPI)进行语料库的数据增广,首先构建“水产品名称”同类词词典和领域同义词词典,通过两个词典分别对“水产品名称”类实体和随机词进行同类词替换和同义词替换,生成新的句子,以增加目标实体数量和句子的多样性,然后在基于槽点保护的情况下对原句子分别进行随机删除和随机插入操作,在保留实体及上下文特征的情况下进一步丰富语料的多样性,提高模型的泛化能力。结果表明,采用基于融合注意力机制的BERT+BiLSTM+CRF网络模型和多元组合数据增广方法进行渔业标准命名实体识别,准确率、召回率、F1值分别达到了91.73%、88.64%、90.16%,具有较好的效果。研究表明,基于多元组合数据增广的渔业标准命名实体识别方法有效解决了部分实体样本稀疏问题,提升了渔业标准命名实体识别的整体效果。展开更多
文摘为解决水产医学命名实体识别中存在的嵌套实体识别准确率不高的问题,提出一种基于多核卷积的命名实体识别模型(BERT+Multi-CNN+CRF),采用多核卷积神经网络提取嵌套实体特征,通过BERT(bidirectional encoder representations from transformers)方法对输入语料进行预训练,丰富嵌套实体位置向量信息,获得嵌套实体输入特征矩阵,将提取特征矩阵与输入特征矩阵融合,以增强嵌套实体的特征表示,并进行不同模型的对比试验。结果表明,本文中提出的BERT+Multi-CNN+CRF模型,在水产医学嵌套命名实体识别任务中的准确率、召回率和F1值分别为88.04%、88.92%和88.48%,与识别准确率较高的BERT+BiLSTM+ATT+CRF模型相比,分别提高了2.25%、3.23%和2.74%。研究表明,本文中提出的BERT+Multi-CNN+CRF模型可有效解决水产医学嵌套实体识别准确率不高的问题,是一种有效的水产医学嵌套命名实体识别方法。
文摘为解决渔业标准命名实体识别任务中部分实体语料分布稀疏导致的效果不佳问题,提出了基于多元组合数据增广(data augmentation method based on multiple combination,MCA)的渔业标准命名实体识别方法,该方法融合了基于领域词典的联合替换算法(joint replacement algorithm based on domain dictionary,DDR)、基于槽点保护的随机删除算法(random deletion algorithm based on slot protection,SPD)和基于槽点保护的随机插入算法(random insertion algorithm based on slot protection,SPI)进行语料库的数据增广,首先构建“水产品名称”同类词词典和领域同义词词典,通过两个词典分别对“水产品名称”类实体和随机词进行同类词替换和同义词替换,生成新的句子,以增加目标实体数量和句子的多样性,然后在基于槽点保护的情况下对原句子分别进行随机删除和随机插入操作,在保留实体及上下文特征的情况下进一步丰富语料的多样性,提高模型的泛化能力。结果表明,采用基于融合注意力机制的BERT+BiLSTM+CRF网络模型和多元组合数据增广方法进行渔业标准命名实体识别,准确率、召回率、F1值分别达到了91.73%、88.64%、90.16%,具有较好的效果。研究表明,基于多元组合数据增广的渔业标准命名实体识别方法有效解决了部分实体样本稀疏问题,提升了渔业标准命名实体识别的整体效果。