-
题名融合图嵌入和注意力机制的代码搜索
被引量:4
- 1
-
-
作者
黄思远
赵宇海
梁燚铭
-
机构
东北大学计算机科学与工程学院
-
出处
《计算机科学与探索》
CSCD
北大核心
2022年第4期844-854,共11页
-
基金
国家自然科学基金(61772124)
国家重点研发计划(2018YFB1004402)。
-
文摘
源代码检索任务是指将自然语言作为查询语句,从代码库中搜索相关代码片段。在代码检索任务中,大多数代码检索算法只考虑代码片段的文本序列信息而未考虑代码的结构信息,导致不能充分捕获代码片段包含的语义和语法信息。为了提高对程序语言的理解,提出了注意力机制和图嵌入相结合的代码检索算法(GraphCS)。在特征提取部分,以LSTM提取文本特征向量表示,以Graph2Vec提取图的向量特征表示。在特征融合部分中引入注意力机制,更好地为每一个特征分配相应的权重,从而提升程序的理解。考虑源代码和自然语言为异构数据,将代码片段特征和自然语言特征映射到同一个向量空间,以排名损失来保证语义相似的点在特征空间拥有较近的距离。为了验证算法的高效性,与目前最好的算法CODEnn进行对比。实验结果表明,在Precision@1/5/10、SuccessRate@1/5/10以及MRR上均有一定的提升。
-
关键词
源代码检索
注意力机制
图嵌入
自然语言
语义相似
向量空间
-
Keywords
source code retrieval
attention mechanism
graph embedding
natural language
semantic similarity
vector space
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-