关闭

网络爬虫_基于各种语言的开源网络爬虫总汇

时间: 2018-05-10阅读: 1944标签: 爬虫作者: 转载

网络爬虫是什么? 

网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。

是互联网爬虫,蜘蛛,数据采集器,网页解析器的汇总。下面介绍各语言实现网络爬虫的开源框架


Python

  • Scrapy - 一种高效的屏幕,网页数据采集框架。
  • pyspider - 一个强大纯python的数据采集系统.
  • cola - 一个分布式的爬虫框架.
  • Demiurge - 基于PyQuery的微型爬虫框架.
  • Scrapely - 一个纯python的html页面捕捉库.
  • feedparser - 一个通用的feed解析器.
  • you-get - 静默网站爬去下载器.
  • Grab - 网站采集框架.
  • MechanicalSoup - 一个自动化的互动网站Python库.
  • portia - 基于Scrapy的可视化数据采集框架.
  • crawley - 基于非阻塞通信(NIO)的python爬虫框架.
  • RoboBrowser - 一个简单的,不基于Web浏览器的基于Python的Web 浏览器.
  • MSpider - 一个基于gevent(协程网络库)的python爬虫.
  • brownant - 一个轻量级的网络数据抽取框架.


Java

  • Apache Nutch - 用于生产环境的高度可扩展的高度可扩展的网络爬虫.
    • anthelion - 一个基于Apache Nutch抓取语义注释在html页面插件.
  • Crawler4j - 简单和轻量级的网络爬虫.
  • JSoup - 采集,分析,处理和清洗HTML页面.
  • websphinx - HTML网站特定的处理、信息提取.
  • Open Search Server - 全套搜索功能,建立你自己的索引策略。分析、提取全文数据,这个框架可以索引的一切.
  • Gecco - 一个易于使用的轻量级网络爬虫.
  • WebCollector -简单的抓取网页的界面,可以在不到5分钟内部署一个多线程的网络爬虫.
  • Webmagic -一个可扩展的爬虫框架.
  • Spiderman -一个可扩展的,多线程的网络爬虫.
  • Heritrix3 - 可扩展,大规模的网络爬虫项目.
  • SeimiCrawler - 一个敏捷的分布式爬虫框架.
  • StormCrawler - 基于开放源代码、构建低延迟的网络资源采集框架,基于Apache Storm.
  • Spark-Crawler - 基于Apache Nutch 的网络爬虫,可以运行于Spark.


C#

  • ccrawler - 一个简单的Web内容分类方案,它可以根据其内容分开网页,基于C#3.5.
  • SimpleCrawler - 简单的多线程网络爬虫,基于REG表达式.
  • DotnetSpider - 基于C#开发的一个轻量级,交叉平台的网络爬虫.
  • Abot - 具有很好效率和可扩展性的C#网络爬虫.
  • Hawk -  用 C#/WPF开发的网络爬虫,具有简单的ETL功能.
  • SkyScraper - 一个支持异步网络和有很好扩展性的网络爬虫.


JavaScript

  • scraperjs - 基于js的一个功能齐全的网络爬虫.
  • scrape-it - 基于Node.js的网络爬虫.
  • simplecrawler - 基于事件驱动开发的网络爬虫.
  • node-crawler - 提供简单API,适于二次开发的网络爬虫.
  • js-crawler - 基于Node.JS,支持HTTP(S)的网络爬虫.
  • x-ray - 支持分页的网络爬虫.
  • node-osmosis - 基于Node.js适于解析HTML结构的网络爬虫.


php

  • Goutte - 基于PHP的网页截屏和爬取程序.
  • dom-crawler - 易于抽取DOM文件的网络爬虫.
  • pspider - 基于PHP的并发网络爬虫.
  • php-spider - 一个基于PHP的高可扩展的网络爬虫.


C++


C

  • httrack - 全部网站整体复制工具。 ## Ruby
  • upton - 一个易于上手的爬虫框架集合,支持css选择器.
  • wombat - 基于Ruby天然的支持DSL的网络爬虫,易于提取网页正文数据.
  • RubyRetriever - 基于Ruby的网站数据采集和全网数据收割机.
  • Spidr - 全站数据采集,支持无限的网站链接地址采集.
  • Cobweb - 非常灵活,易于扩展的网络爬虫,可以单点部署使用.
  • mechanize - 自动采集网站数据的框架.


R

  • rvest - 基于R开发的简单网络爬虫.


Erlang

  • ebot - 一个分布式,高可扩展的网络爬虫.


Perl

  • web-scraper - 方便使用HTML、css、XPath选择器的网络爬虫。


Go

  • pholcus - 一个分布式,支持高并发的网络爬虫.
  • gocrawl - 一个高并发的,轻量级,遵守道德的网络爬虫.
  • fetchbot -一个遵守robots.txt规则和延迟规则的轻量级网络爬虫.
  • go_spider - 一个非常好的高并发网络爬虫.
  • dht -支持DHT协议的网络爬虫.
  • ants-go - 基于Golang的高并行网络爬虫.
  • scrape - 一个简单的提供很好开发接口的网络爬虫.


Scala

  • crawler - 基于Scala DSL的网络爬虫.
  • scrala - 由Scala开发基于scrapy内核的网络爬虫.
  • ferrit - 基于Scala开发使用了Akka, Spray,Cassandra的网络爬虫.


站长推荐

1.云服务推荐: 国内主流云服务商,各类云产品的最新活动,优惠券领取。地址:阿里云腾讯云华为云

2.广告联盟: 整理了目前主流的广告联盟平台,如果你有流量,可以作为参考选择适合你的平台点击进入

链接: http://www.fly63.com/article/detial/754

关闭

使用Node.js爬取任意网页资源并输出高质量PDF文件到本地

本文适合无论是否有爬虫以及 Node.js 基础的朋友观看~如果你是一名技术人员,那么可以看我接下来的文章,否则,请直接移步到我的 github 仓库,直接看文档使用即可

爬虫解决网页重定向问题

每个网站主页是网站资源的入口,当重定向发生在网站主页时,如果不能正确处理就很有可能会错失这整个网站的内容。 笔者编写的爬虫在爬取网页时遇到了三种重定向的情况。

node可以做爬虫吗?

node可以做爬虫,下面我们来看一下如何使用node来做一个简单的爬虫。node做爬虫的优势:第一个就是他的驱动语言是JavaScript。JavaScript在nodejs诞生之前是运行在浏览器上的脚本语言,其优势就是对网页上的dom元素进行操作

不会这几个库,都不敢说我会Python爬虫

很多朋友不知道Python爬虫怎么入门,怎么学习,到底要学习哪些内容。今天我来给大家说说学习爬虫,我们必须掌握的一些第三方库。废话不多说,直接上干货。

nodejs能爬虫么?

nodejs可以爬虫。Node.js出现后,爬虫便不再是后台语言如PHP,Python的专利了,尽管在处理大量数据时的表现仍然不如后台语言,但是Node.js异步编程的特性可以让我们在最少的cpu开销下轻松完成高并发的爬取。

8个Python爬虫框架

Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架。 可以应用在包括数据挖掘,信息处理或存储历史数据等一系列的程序中。pyspider 是一个用python实现的功能强大的网络爬虫系统,能在浏览器界面上进行脚本的编写

什么是网络爬虫,网络爬虫有什么用?

网络爬虫在数据采集方面有好的优势,比如采集速度快,比人来操作可能要快一千倍一万倍都不止;方便将获取的数据进行相关的清洗加工以及储存工作;代码可重复使用,或者说是一劳永逸。

javascript可以爬虫吗?

网络爬虫(又被称为网页蜘蛛,网络机器人),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。

网络爬虫程序员被抓,我们还敢爬虫吗?

某大数据科技公司老板丢给一个小小的程序员一个网站,告诉他把这个网站的数据抓取下来,咱们做一做分析。这个小小的程序员就吭哧吭哧的写了一段抓取代码,测试了一下,程序没问题,可以正常的把这个网站的数据给抓取下来

爬虫最终杀手锏 --- PhantomJS 详解(附案例)

PhantomJS无界面的浏览器:认识PhantomJS、网站模拟登录豆瓣网、动态页面模拟点击(unittest -python测试模块)、执行JavaScript代码、模拟最新无界面浏览器...

点击更多...

内容以共享、参考、研究为目的,不存在任何商业目的。其版权属原作者所有,如有侵权或违规,请与小编联系!情况属实本人将予以删除!