专业提供无毒且安全的软件及游戏下载!
当前位置:首页 > 电脑软件 > 网络工具 >GeneralNewsExtractor(新闻网页正文通用抽取器) v0.2.6 官方版

GeneralNewsExtractor(新闻网页正文通用抽取器) v0.2.6 官方版

  • 软件大小:19KB
  • 更新日期:2021-04-27
  • 语言:简体中文
  • 类别:网络工具
  • 适用环境:WinAll
  • 安全检测: 无插件 360通过 腾讯通过 金山通过 瑞星通过
  • 本地下载

    普通http下载速度慢

软件介绍

GeneralNewsExtractor是一款基于Python语言的网页正文通用抽取器,我们可以使用这款软件来将HTML中正文的内容、作者、标题全部提取出来进行使用,非常方便快捷。

GeneralNewsExtractor下载

软件简介

GeneralNewsExtractor(新闻网页正文通用抽取器)是一个基于《基于文本及符号密度的网页正文提取方法》论文用Python实现的正文抽取器,可以用来提取 HTML 中正文的内容、作者、标题。

GeneralNewsExtractor软件说明

项目起源

开发这个项目,源自于我在知网发现了一篇关于自动化抽取新闻类网站正文的算法论文——《基于文本及符号密度的网页正文提取方法》)

这篇论文中描述的算法看起来简洁清晰,并且符合逻辑。但由于论文中只讲了算法原理,并没有具体的语言实现,所以我使用 Python 根据论文实现了这个抽取器。并分别使用今日头条、网易新闻、游民星空、观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻做了测试,发现提取效果非常出色,几乎能够达到100%的准确率。

项目现状

在论文中描述的正文提取基础上,我增加了标题、发布时间和文章作者的自动化探测与提取功能。

目前这个项目是一个非常非常早期的 Demo,发布出来是希望能够尽快得到大家的使用反馈,从而能够更好地有针对性地进行开发。

本项目取名为抽取器,而不是爬虫,是为了规避不必要的风险,因此,本项目的输入是 HTML,输出是一个字典。请自行使用恰当的方法获取目标网站的 HTML。

本项目现在不会,将来也不会提供主动请求网站 HTML 的功能。

用户评论
所有评论(5)
昵称:
(您的评论需要经过审核才能显示)
精选留言 来自浙江舟山移动用户 发表于: 2023-11-23
谢谢。 一直没用过 这回试下。
精选留言 来自云南保山联通用户 发表于: 2023-1-18
成功下载&成功使用
精选留言 来自吉林长春联通用户 发表于: 2023-2-12
不错,顶一下
精选留言 来自江苏常州电信用户 发表于: 2023-2-12
不错,支持一下!
精选留言 来自陕西咸阳移动用户 发表于: 2023-2-12
谢谢大佬分享,先下载了,以备不时之需。

软件投诉或纠错

问题:
说明:
邮箱: