我是如何使用 webBee 分析知乎 20w 用户数据的

本贴最后更新于 2898 天前,其中的信息可能已经物是人非

首先说一下我使用的工具:
项目地址: https://github.com/pkwenda/webBee

webBee是我为了深入学习而写的一个爬虫框架,新生儿1个月,但我打算一直做下去 首先我需要数据来测试修改我的框架啊,我想到了知乎的用户数据就是一个非常好的免费资源,不过想‘偷’知乎大大嘛... 还是要费点心思的。随便找了个知乎网红 (QaQ 美女学霸有木有!)

在这里呢,介绍一下我的框架

他是一个垂直爬虫[只针对单个网站的深入爬取]不是类似百度、google的爬虫引擎 因为还没完全开发完,暂时还没有上传到maven中央仓库,不过大家可以下载项目用maven build个jar包拿来用 目前正在完善core核心包和redis插件包

当然你也没必要写这么多,随便写写就行主要是cookie 这些东西相信用过postman 或者 Paw等web接口测试工具的童鞋很熟悉了 [ps:这部分其实有很多优化的部分,我下一步要不算的自动随机模拟useragent、代理ip等。防止反扒网站很容易抓到我们] 最主要的其实是cookie,这部分我原来其实是实现的 你利用Jquery的语法来选择 user-password的from表单进行登录的。 但是,因为目前web端五花八门而且提高用户门槛被我放弃了。一律cookie。

设置 cookie 的两种方式:

setting.setCookies(key,value).setCookies(key,value)..... //可以链式调用哦 setting.addHeader('cookie','value') //你可以一次写完也可以链式

那么有些小白童鞋就会问了怎么看网站 cookie 呢?

我们主要讲一下那些 cookie,是知乎是认为你必须携带的?我们分析下知乎发送的包

知道了吧,这可以当做有效期内的密码来用

webBee 你的方法只需要实现 PageProcessor 接口即可灵感来自 servletwebMagic 的面向接口设计。

public class FetchZhihu implements PageProcessor @Override public void process(Page page) throws IOException {... //用来获取结果的 @Override public Setting getSetting() {... //用来设置请求的[header/cookie/下一页等]

比如在 process 里面

page.getApi(); //这样就拿到了返回的数据 private RedisSet redisHash = new RedisSet(); redisHash.insert("zhihu_user_yet",page.getApi());//这样就完成了redis的缓存、持久化。

类似笔者巴拉巴拉一顿逼逼,开它两三个线程先来 20w 玩玩

【ps:多线程代码没测试完还没提交到github,汗。。。】 踩过的坑: 1、爬的太快被知乎封号24小时(建议大家用小号) 2、知乎不定时会对频率快的进行延时(已处理) 3、建议模仿用户行为早中晚各2个小时【这部分我会再写定时任务插件】

我自己 3 个线程[线程有最佳线程算法的哦,不要以为越多越好],不到 4 个小时后到手 20w

我使用 redis-dump 插件导出 json 文件,放在我那个 7 元一年的静态仅能运行 html 和 js 的,200mb 硬盘的,无敌屌丝服务器上跑 20w 数据,json 文件都达到 115mb,跑了 3 分钟,汗....

下面我们随便写写 js,简单分一下 20w 用户的男女比例和粉丝比例分析:
【动态图怎么传上去变静态的了!哭,重新截图吧】



对你发现了么?没错,我忘了知乎有 4w 不男不女了!!

下面粉丝分析:
10000+ 粉丝 422 人

1000-10000: 1630 人

剩余的大家自己看吧。


我倒是真没想到,我那么垃圾的服务器还能跑 20w 数据,哈哈哈哈哈哈

大家可能会有顾虑了,webBee 只能 redis?当然不是,考虑数据量方面我先弄 redis,当然我不提供插件大家也可以用 jdbc 、jpa、Mbatis、之类的,但是我会提供更简单的 mysql、mongod 等持久化操作插件,后续效果好可能会提供 elasticSearch 插件,但是涉及到工作量,还是希望大家多多参与贡献啦。

webBee 还有茫茫多的事情要处理,还会集成 htmlunit 等分析异步网站,监听弹幕网站等接口。

赶快给我点赞吧!0.0

项目地址: https://github.com/pkwenda/webBee

java 开源讨论群:147255248

  • Java

    Java 是一种可以撰写跨平台应用软件的面向对象的程序设计语言,是由 Sun Microsystems 公司于 1995 年 5 月推出的。Java 技术具有卓越的通用性、高效性、平台移植性和安全性。

    3195 引用 • 8215 回帖
  • webBee
    2 引用 • 11 回帖
  • 爬虫

    网络爬虫(Spider、Crawler),是一种按照一定的规则,自动地抓取万维网信息的程序。

    106 引用 • 275 回帖
  • 知乎

    知乎是网络问答社区,连接各行各业的用户。用户分享着彼此的知识、经验和见解,为中文互联网源源不断地提供多种多样的信息。

    10 引用 • 66 回帖 • 1 关注

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...
请输入回帖内容 ...

推荐标签 标签

  • Redis

    Redis 是一个开源的使用 ANSI C 语言编写、支持网络、可基于内存亦可持久化的日志型、Key-Value 数据库,并提供多种语言的 API。从 2010 年 3 月 15 日起,Redis 的开发工作由 VMware 主持。从 2013 年 5 月开始,Redis 的开发由 Pivotal 赞助。

    286 引用 • 248 回帖 • 13 关注
  • Kotlin

    Kotlin 是一种在 Java 虚拟机上运行的静态类型编程语言,由 JetBrains 设计开发并开源。Kotlin 可以编译成 Java 字节码,也可以编译成 JavaScript,方便在没有 JVM 的设备上运行。在 Google I/O 2017 中,Google 宣布 Kotlin 成为 Android 官方开发语言。

    19 引用 • 33 回帖 • 76 关注
  • Swagger

    Swagger 是一款非常流行的 API 开发工具,它遵循 OpenAPI Specification(这是一种通用的、和编程语言无关的 API 描述规范)。Swagger 贯穿整个 API 生命周期,如 API 的设计、编写文档、测试和部署。

    26 引用 • 35 回帖 • 3 关注
  • 微软

    微软是一家美国跨国科技公司,也是世界 PC 软件开发的先导,由比尔·盖茨与保罗·艾伦创办于 1975 年,公司总部设立在华盛顿州的雷德蒙德(Redmond,邻近西雅图)。以研发、制造、授权和提供广泛的电脑软件服务业务为主。

    8 引用 • 44 回帖
  • webpack

    webpack 是一个用于前端开发的模块加载器和打包工具,它能把各种资源,例如 JS、CSS(less/sass)、图片等都作为模块来使用和处理。

    41 引用 • 130 回帖 • 250 关注
  • SEO

    发布对别人有帮助的原创内容是最好的 SEO 方式。

    35 引用 • 200 回帖 • 20 关注
  • V2EX

    V2EX 是创意工作者们的社区。这里目前汇聚了超过 400,000 名主要来自互联网行业、游戏行业和媒体行业的创意工作者。V2EX 希望能够成为创意工作者们的生活和事业的一部分。

    16 引用 • 236 回帖 • 269 关注
  • Angular

    AngularAngularJS 的新版本。

    26 引用 • 66 回帖 • 543 关注
  • Typecho

    Typecho 是一款博客程序,它在 GPLv2 许可证下发行,基于 PHP 构建,可以运行在各种平台上,支持多种数据库(MySQL、PostgreSQL、SQLite)。

    12 引用 • 67 回帖 • 445 关注
  • ReactiveX

    ReactiveX 是一个专注于异步编程与控制可观察数据(或者事件)流的 API。它组合了观察者模式,迭代器模式和函数式编程的优秀思想。

    1 引用 • 2 回帖 • 176 关注
  • ZeroNet

    ZeroNet 是一个基于比特币加密技术和 BT 网络技术的去中心化的、开放开源的网络和交流系统。

    1 引用 • 21 回帖 • 639 关注
  • Follow
    4 引用 • 12 回帖 • 9 关注
  • C

    C 语言是一门通用计算机编程语言,应用广泛。C 语言的设计目标是提供一种能以简易的方式编译、处理低级存储器、产生少量的机器码以及不需要任何运行环境支持便能运行的编程语言。

    85 引用 • 165 回帖 • 1 关注
  • InfluxDB

    InfluxDB 是一个开源的没有外部依赖的时间序列数据库。适用于记录度量,事件及实时分析。

    2 引用 • 87 关注
  • 设计模式

    设计模式(Design pattern)代表了最佳的实践,通常被有经验的面向对象的软件开发人员所采用。设计模式是软件开发人员在软件开发过程中面临的一般问题的解决方案。这些解决方案是众多软件开发人员经过相当长的一段时间的试验和错误总结出来的。

    200 引用 • 120 回帖
  • RYMCU

    RYMCU 致力于打造一个即严谨又活泼、专业又不失有趣,为数百万人服务的开源嵌入式知识学习交流平台。

    4 引用 • 6 回帖 • 53 关注
  • Excel
    31 引用 • 28 回帖
  • 尊园地产

    昆明尊园房地产经纪有限公司,即:Kunming Zunyuan Property Agency Company Limited(简称“尊园地产”)于 2007 年 6 月开始筹备,2007 年 8 月 18 日正式成立,注册资本 200 万元,公司性质为股份经纪有限公司,主营业务为:代租、代售、代办产权过户、办理银行按揭、担保、抵押、评估等。

    1 引用 • 22 回帖 • 783 关注
  • SSL

    SSL(Secure Sockets Layer 安全套接层),及其继任者传输层安全(Transport Layer Security,TLS)是为网络通信提供安全及数据完整性的一种安全协议。TLS 与 SSL 在传输层对网络连接进行加密。

    70 引用 • 193 回帖 • 415 关注
  • Solo

    Solo 是一款小而美的开源博客系统,专为程序员设计。Solo 有着非常活跃的社区,可将文章作为帖子推送到社区,来自社区的回帖将作为博客评论进行联动(具体细节请浏览 B3log 构思 - 分布式社区网络)。

    这是一种全新的网络社区体验,让热爱记录和分享的你不再感到孤单!

    1440 引用 • 10067 回帖 • 493 关注
  • NetBeans

    NetBeans 是一个始于 1997 年的 Xelfi 计划,本身是捷克布拉格查理大学的数学及物理学院的学生计划。此计划延伸而成立了一家公司进而发展这个商用版本的 NetBeans IDE,直到 1999 年 Sun 买下此公司。Sun 于次年(2000 年)六月将 NetBeans IDE 开源,直到现在 NetBeans 的社群依然持续增长。

    78 引用 • 102 回帖 • 702 关注
  • Postman

    Postman 是一款简单好用的 HTTP API 调试工具。

    4 引用 • 3 回帖 • 1 关注
  • WordPress

    WordPress 是一个使用 PHP 语言开发的博客平台,用户可以在支持 PHP 和 MySQL 数据库的服务器上架设自己的博客。也可以把 WordPress 当作一个内容管理系统(CMS)来使用。WordPress 是一个免费的开源项目,在 GNU 通用公共许可证(GPLv2)下授权发布。

    66 引用 • 114 回帖 • 198 关注
  • 宕机

    宕机,多指一些网站、游戏、网络应用等服务器一种区别于正常运行的状态,也叫“Down 机”、“当机”或“死机”。宕机状态不仅仅是指服务器“挂掉了”、“死机了”状态,也包括服务器假死、停用、关闭等一些原因而导致出现的不能够正常运行的状态。

    13 引用 • 82 回帖 • 84 关注
  • Lute

    Lute 是一款结构化的 Markdown 引擎,支持 Go 和 JavaScript。

    28 引用 • 197 回帖 • 26 关注
  • Access
    1 引用 • 3 回帖 • 4 关注
  • Eclipse

    Eclipse 是一个开放源代码的、基于 Java 的可扩展开发平台。就其本身而言,它只是一个框架和一组服务,用于通过插件组件构建开发环境。

    76 引用 • 258 回帖 • 630 关注