-
题名基于邮件正文的邮箱用户别名抽取
被引量:2
- 1
-
-
作者
尹美娟
陈庶民
刘晓楠
路林
-
机构
信息工程大学信息工程学院
-
出处
《计算机科学》
CSCD
北大核心
2011年第12期182-186,199,共6页
-
基金
某国防基金资助
-
文摘
邮箱用户身份信息挖掘是数据挖掘研究的一个热点。当前相关研究大多仅从邮件头中抽取邮箱用户的别名,遗漏了邮件正文中潜藏的更能代表通信双方身份的别名信息。针对纯文本邮件正文中邮箱用户别名信息抽取问题,提出了基于统计和规则过滤的称呼块和签名块定位算法,该算法能高效准确地从邮件正文中提取出蕴涵邮箱用户别名的称呼块和签名块文本片段;进一步提出了基于别名边界词汇模板修正的别名抽取方法,从而提高了仅基于命名实体识别或词性标注工具识别别名的准确率。实验结果表明,提出的方法可以有效地抽取出邮件正文中邮箱用户的别名。
-
关键词
实体解析
邮件正文
别名抽取
称呼块签名块定位
别名边界词汇模板
-
Keywords
Entity resolution, Email body, Alias Extraction, Salutation and signature blocks locating, Name boundaryword template
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-