一周内从 0 到 1 掌握 Node 爬虫技巧(二)

本贴最后更新于 2504 天前,其中的信息可能已经渤澥桑田

上篇文章介绍了爬虫的基本概念和基本原理,这篇开始我们一起来看看具体如何从网页中爬取自己想要的数据。

在下面爬虫的栗子中,我们使用 nodejs 来作为我们的运行环境(我是前端工程师哦)!

一、准备环境

1、nodejs 环境安装可以点击这里 nodejs 中文网下载安装包哦!

二、创建项目

1、安装好 nodejs 后,运行 cmd 切换到你想要创建的目录;

2、mkdir myspider(创建 myspider 文件夹);

3、cd 到 myspider 目录下;

4、命令行输入 npm init(初始化该小项目):

此时需要填写一些项目信息,你可以根据情况填写,当然也可以一路回车哦。

初始化过程中会产生这些选项

执行完成后会有一个 packge.json 配置文件:

里面包含我们这个项目的一些信息

5、安装第三方包库

这些包库在程序中引入会自动加载的哦。这些包库的使用不仅会大大减少我们的代码量,而且还会使我们的代码更优雅、更好维护哦。

我们的所有第三方库都是依赖于 npm(node package manager)node 包管理器来下载,只需要运行 npm install xxx --save 来安装,了解更多关于 npm 点击这里查看。(我觉得这就是 nodejs 发展异常迅速的原因之一)

1)、express(npm install express --save)

express 库为我们提供了一系列便捷的方法,让我们管理和构建大型项目变的非常简单;小项目就更不必说了。更多关于 express 可以点击这里查看

2)、cheerio(npm install express --save)

cherrio 是为服务器特别定制的,快速、灵活、实施的 jQuery 核心实现。通过 cherrio,我们就可以将抓取到的内容,像使用 jquery 的方式来使用了。可以点击这里查看

简单示例如下:

varcheerio = require('cheerio');

$= cheerio.load('Hello world');

$('h2.title').text('Hello there!');

3)、superagent(npm install superagent --save)

superagent 模块让 http 请求变的更加简单,了解更多点击这里查看。最简单的一个示例如下:

var request = require('superagent');

request.get('http://example.com/search').end(function(res){});

有些模块是 nodejs 中的内置模块不需要使用 npm 来下载的,还有其他第三方模块会在后续文章中陆续介绍。

三、开始你的表演。。。

安装完上面的包,我们就可以开始简单的实践喽!在 myspider 文件加下创建 app.js。如下图 :

var express=require('express');

var cheerio=require('cheerio');

var request=require('superagent');

var app=express();

app.get('/',function(req,res){

console.log('hello man!');

});

app.listen(function(req,res) {

console.log('server is running at port 3000!');

});

然后在命令行运行 node app.js,如图:

运行 node app.js

接着在浏览器地址栏输入 localhost:3000/,回车,如图:

地址栏输入 localhost:3000

这样一个简单的本地服务器模拟就实现了哦!

接下来我们就看看在服务器中使用 request 向我们的目标网站发起 http 请求,将原来代码改为:

app.get('/',function(req,res){

request.get('http://www.dytt8.net').end(function(err,ress) {

if(!err) {

      res.send('请求成功喽!');

 }

});

});

我们这样就可以进入我们要爬取网站了!

我们引入 cheerio 包帮我们实现我们想要爬取的内容,将 app.js 代码改一下:

var express=require('express');

var cheerio=require('cheerio');

var charset=require('superagent-charset');//解决网页编码问题

var request=require('superagent');

var app=express();

charset(request);

app.get('/',function(req,res){

request.get('http://www.dytt8.net').charset('gb2312').end(function(err,ress) {

//错误处理

if(err){

console.log(err);

}else{

var $=cheerio.load(ress.text);//$和jquery中的选择器类似,可以选择网页中所有的元素

var  navText=$('#menu .contain ul li a').text();

res.end(navText);

}

});

});

app.listen(3000,function(req,res) {

console.log('server is running at port 3000!');

});

浏览器运行结果如下:

爬取的结果

到此一个最简单的爬虫程序就基本实践成功了,后续会逐步实现更为复杂的爬虫程序,希望对大家有所帮助。错误难免,敬请斧正!

  • 编程
    50 引用 • 257 回帖 • 3 关注
  • var
    3 引用 • 17 回帖

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...

推荐标签 标签

  • Pipe

    Pipe 是一款小而美的开源博客平台。Pipe 有着非常活跃的社区,可将文章作为帖子推送到社区,来自社区的回帖将作为博客评论进行联动(具体细节请浏览 B3log 构思 - 分布式社区网络)。

    这是一种全新的网络社区体验,让热爱记录和分享的你不再感到孤单!

    131 引用 • 1114 回帖 • 136 关注
  • HHKB

    HHKB 是富士通的 Happy Hacking 系列电容键盘。电容键盘即无接点静电电容式键盘(Capacitive Keyboard)。

    5 引用 • 74 回帖 • 445 关注
  • iOS

    iOS 是由苹果公司开发的移动操作系统,最早于 2007 年 1 月 9 日的 Macworld 大会上公布这个系统,最初是设计给 iPhone 使用的,后来陆续套用到 iPod touch、iPad 以及 Apple TV 等产品上。iOS 与苹果的 Mac OS X 操作系统一样,属于类 Unix 的商业操作系统。

    84 引用 • 139 回帖 • 2 关注
  • 倾城之链
    23 引用 • 66 回帖 • 125 关注
  • Log4j

    Log4j 是 Apache 开源的一款使用广泛的 Java 日志组件。

    20 引用 • 18 回帖 • 26 关注
  • wolai

    我来 wolai:不仅仅是未来的云端笔记!

    2 引用 • 14 回帖 • 4 关注
  • 黑曜石

    黑曜石是一款强大的知识库工具,支持本地 Markdown 文件编辑,支持双向链接和关系图。

    A second brain, for you, forever.

    10 引用 • 88 回帖
  • 资讯

    资讯是用户因为及时地获得它并利用它而能够在相对短的时间内给自己带来价值的信息,资讯有时效性和地域性。

    54 引用 • 85 回帖
  • 开源中国

    开源中国是目前中国最大的开源技术社区。传播开源的理念,推广开源项目,为 IT 开发者提供了一个发现、使用、并交流开源技术的平台。目前开源中国社区已收录超过两万款开源软件。

    7 引用 • 86 回帖 • 1 关注
  • Jenkins

    Jenkins 是一套开源的持续集成工具。它提供了非常丰富的插件,让构建、部署、自动化集成项目变得简单易用。

    52 引用 • 37 回帖 • 2 关注
  • RabbitMQ

    RabbitMQ 是一个开源的 AMQP 实现,服务器端用 Erlang 语言编写,支持多种语言客户端,如:Python、Ruby、.NET、Java、C、PHP、ActionScript 等。用于在分布式系统中存储转发消息,在易用性、扩展性、高可用性等方面表现不俗。

    49 引用 • 60 回帖 • 387 关注
  • JSON

    JSON (JavaScript Object Notation)是一种轻量级的数据交换格式。易于人类阅读和编写。同时也易于机器解析和生成。

    52 引用 • 190 回帖 • 1 关注
  • Mobi.css

    Mobi.css is a lightweight, flexible CSS framework that focus on mobile.

    1 引用 • 6 回帖 • 721 关注
  • SOHO

    为成为自由职业者在家办公而努力吧!

    7 引用 • 55 回帖 • 48 关注
  • 电影

    这是一个不能说的秘密。

    120 引用 • 598 回帖
  • 以太坊

    以太坊(Ethereum)并不是一个机构,而是一款能够在区块链上实现智能合约、开源的底层系统。以太坊是一个平台和一种编程语言 Solidity,使开发人员能够建立和发布下一代去中心化应用。 以太坊可以用来编程、分散、担保和交易任何事物:投票、域名、金融交易所、众筹、公司管理、合同和知识产权等等。

    34 引用 • 367 回帖
  • SVN

    SVN 是 Subversion 的简称,是一个开放源代码的版本控制系统,相较于 RCS、CVS,它采用了分支管理系统,它的设计目标就是取代 CVS。

    29 引用 • 98 回帖 • 698 关注
  • Spark

    Spark 是 UC Berkeley AMP lab 所开源的类 Hadoop MapReduce 的通用并行框架。Spark 拥有 Hadoop MapReduce 所具有的优点;但不同于 MapReduce 的是 Job 中间输出结果可以保存在内存中,从而不再需要读写 HDFS,因此 Spark 能更好地适用于数据挖掘与机器学习等需要迭代的 MapReduce 的算法。

    74 引用 • 46 回帖 • 562 关注
  • Hadoop

    Hadoop 是由 Apache 基金会所开发的一个分布式系统基础架构。用户可以在不了解分布式底层细节的情况下,开发分布式程序。充分利用集群的威力进行高速运算和存储。

    86 引用 • 122 回帖 • 619 关注
  • 周末

    星期六到星期天晚,实行五天工作制后,指每周的最后两天。再过几年可能就是三天了。

    14 引用 • 297 回帖 • 1 关注
  • 服务

    提供一个服务绝不仅仅是简单的把硬件和软件累加在一起,它包括了服务的可靠性、服务的标准化、以及对服务的监控、维护、技术支持等。

    41 引用 • 24 回帖 • 1 关注
  • 小说

    小说是以刻画人物形象为中心,通过完整的故事情节和环境描写来反映社会生活的文学体裁。

    28 引用 • 108 回帖
  • 面试

    面试造航母,上班拧螺丝。多面试,少加班。

    324 引用 • 1395 回帖
  • CloudFoundry

    Cloud Foundry 是 VMware 推出的业界第一个开源 PaaS 云平台,它支持多种框架、语言、运行时环境、云平台及应用服务,使开发人员能够在几秒钟内进行应用程序的部署和扩展,无需担心任何基础架构的问题。

    5 引用 • 18 回帖 • 148 关注
  • Logseq

    Logseq 是一个隐私优先、开源的知识库工具。

    Logseq is a joyful, open-source outliner that works on top of local plain-text Markdown and Org-mode files. Use it to write, organize and share your thoughts, keep your to-do list, and build your own digital garden.

    5 引用 • 62 回帖 • 8 关注
  • WordPress

    WordPress 是一个使用 PHP 语言开发的博客平台,用户可以在支持 PHP 和 MySQL 数据库的服务器上架设自己的博客。也可以把 WordPress 当作一个内容管理系统(CMS)来使用。WordPress 是一个免费的开源项目,在 GNU 通用公共许可证(GPLv2)下授权发布。

    58 引用 • 113 回帖 • 273 关注
  • Facebook

    Facebook 是一个联系朋友的社交工具。大家可以通过它和朋友、同事、同学以及周围的人保持互动交流,分享无限上传的图片,发布链接和视频,更可以增进对朋友的了解。

    4 引用 • 15 回帖 • 460 关注