期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于自动机理论的PDF文本内容抽取 被引量:8
1
作者 王晓娟 谭建龙 +1 位作者 刘燕兵 刘金刚 《计算机应用》 CSCD 北大核心 2012年第9期2491-2495,共5页
现有的从PDF文档抽取文本内容的方法(如PDFBox类库采用的方法)处理速度较低,无法满足高速网络中内容分析的需求,也不能对网络中部分到达的PDF数据包进行流式的处理。为此,提出了基于自动机理论的PDF文本内容抽取方法。该方法通过建立具... 现有的从PDF文档抽取文本内容的方法(如PDFBox类库采用的方法)处理速度较低,无法满足高速网络中内容分析的需求,也不能对网络中部分到达的PDF数据包进行流式的处理。为此,提出了基于自动机理论的PDF文本内容抽取方法。该方法通过建立具有层次的关键字自动机,可以快速地抽取完整PDF文档和不完整PDF文档中的文本内容。在中文和英文PDF文档数据集下的实验结果表明,基于自动机理论的PDF文本内容抽取方法耗时仅为PDFBox方法的17%~37%。 展开更多
关键词 文本内容抽取 自动机 确定的有穷自动机 不完整文档
在线阅读 下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部