计算机科学 ›› 2009, Vol. 36 ›› Issue (11): 235-237.
顾韵华,田伟
GU Yun-hua,TIAN Wei
摘要: 提出了一种基于DOM模型扩展的Web信息提取方法。将Web页面表示为DOM树结构,对DOM树结点进行语义扩展并计算其影响度因子,依据结点的影响度因子进行剪枝,进而提取Wcb页面信息内容。该方法不要求 对网页的结构有预先认识,具有自动和通用的特点。提取结果除可以直接用于W cb浏览外,还可用于互联网数据挖掘、基于主题的搜索引擎等应用中。
No related articles found! |
|