我是如何使用 webBee 分析知乎 20w 用户数据的

本贴最后更新于 2530 天前,其中的信息可能已经物是人非

首先说一下我使用的工具:
项目地址: https://github.com/pkwenda/webBee

webBee是我为了深入学习而写的一个爬虫框架,新生儿1个月,但我打算一直做下去
首先我需要数据来测试修改我的框架啊,我想到了知乎的用户数据就是一个非常好的免费资源,不过想‘偷’知乎大大嘛...
还是要费点心思的。随便找了个知乎网红 (QaQ 美女学霸有木有!)

在这里呢,介绍一下我的框架

 他是一个垂直爬虫[只针对单个网站的深入爬取]不是类似百度、google的爬虫引擎
 因为还没完全开发完,暂时还没有上传到maven中央仓库,不过大家可以下载项目用maven build个jar包拿来用 
 目前正在完善core核心包和redis插件包

当然你也没必要写这么多,随便写写就行主要是cookie
这些东西相信用过postman 或者 Paw等web接口测试工具的童鞋很熟悉了
 [ps:这部分其实有很多优化的部分,我下一步要不算的自动随机模拟useragent、代理ip等。防止反扒网站很容易抓到我们]
 最主要的其实是cookie,这部分我原来其实是实现的 你利用Jquery的语法来选择 user-password的from表单进行登录的。
但是,因为目前web端五花八门而且提高用户门槛被我放弃了。一律cookie。 

设置 cookie 的两种方式:

setting.setCookies(key,value).setCookies(key,value)..... //可以链式调用哦
setting.addHeader('cookie','value') //你可以一次写完也可以链式

那么有些小白童鞋就会问了怎么看网站 cookie 呢?

我们主要讲一下那些 cookie,是知乎是认为你必须携带的?我们分析下知乎发送的包

知道了吧,这可以当做有效期内的密码来用

webBee 你的方法只需要实现 PageProcessor 接口即可灵感来自 servletwebMagic 的面向接口设计。

public class FetchZhihu implements PageProcessor

   @Override
    public void process(Page page) throws IOException {... //用来获取结果的
    
     @Override
    public Setting getSetting() {... //用来设置请求的[header/cookie/下一页等]

比如在 process 里面

 page.getApi(); //这样就拿到了返回的数据
 
 private RedisSet redisHash = new RedisSet();
 redisHash.insert("zhihu_user_yet",page.getApi());//这样就完成了redis的缓存、持久化。

类似笔者巴拉巴拉一顿逼逼,开它两三个线程先来 20w 玩玩

【ps:多线程代码没测试完还没提交到github,汗。。。】
踩过的坑:
1、爬的太快被知乎封号24小时(建议大家用小号)
2、知乎不定时会对频率快的进行延时(已处理)
3、建议模仿用户行为早中晚各2个小时【这部分我会再写定时任务插件】

我自己 3 个线程[线程有最佳线程算法的哦,不要以为越多越好],不到 4 个小时后到手 20w

我使用 redis-dump 插件导出 json 文件,放在我那个 7 元一年的静态仅能运行 html 和 js 的,200mb 硬盘的,无敌屌丝服务器上跑 20w 数据,json 文件都达到 115mb,跑了 3 分钟,汗....

下面我们随便写写 js,简单分一下 20w 用户的男女比例和粉丝比例分析:
【动态图怎么传上去变静态的了!哭,重新截图吧】



对你发现了么?没错,我忘了知乎有 4w 不男不女了!!

下面粉丝分析:
10000+ 粉丝 422 人

1000-10000: 1630 人

剩余的大家自己看吧。


我倒是真没想到,我那么垃圾的服务器还能跑 20w 数据,哈哈哈哈哈哈

大家可能会有顾虑了,webBee 只能 redis?当然不是,考虑数据量方面我先弄 redis,当然我不提供插件大家也可以用 jdbc 、jpa、Mbatis、之类的,但是我会提供更简单的 mysql、mongod 等持久化操作插件,后续效果好可能会提供 elasticSearch 插件,但是涉及到工作量,还是希望大家多多参与贡献啦。

webBee 还有茫茫多的事情要处理,还会集成 htmlunit 等分析异步网站,监听弹幕网站等接口。

赶快给我点赞吧!0.0

项目地址: https://github.com/pkwenda/webBee

java 开源讨论群:147255248

  • Java

    Java 是一种可以撰写跨平台应用软件的面向对象的程序设计语言,是由 Sun Microsystems 公司于 1995 年 5 月推出的。Java 技术具有卓越的通用性、高效性、平台移植性和安全性。

    3165 引用 • 8206 回帖 • 1 关注
  • webBee
    2 引用 • 11 回帖
  • 爬虫

    网络爬虫(Spider、Crawler),是一种按照一定的规则,自动地抓取万维网信息的程序。

    106 引用 • 275 回帖
  • 知乎

    知乎是网络问答社区,连接各行各业的用户。用户分享着彼此的知识、经验和见解,为中文互联网源源不断地提供多种多样的信息。

    10 引用 • 66 回帖

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...

推荐标签 标签

  • Webswing

    Webswing 是一个能将任何 Swing 应用通过纯 HTML5 运行在浏览器中的 Web 服务器,详细介绍请看 将 Java Swing 应用变成 Web 应用

    1 引用 • 15 回帖 • 633 关注
  • TensorFlow

    TensorFlow 是一个采用数据流图(data flow graphs),用于数值计算的开源软件库。节点(Nodes)在图中表示数学操作,图中的线(edges)则表示在节点间相互联系的多维数据数组,即张量(tensor)。

    20 引用 • 19 回帖 • 1 关注
  • 又拍云

    又拍云是国内领先的 CDN 服务提供商,国家工信部认证通过的“可信云”,乌云众测平台认证的“安全云”,为移动时代的创业者提供新一代的 CDN 加速服务。

    21 引用 • 37 回帖 • 506 关注
  • 思源笔记

    思源笔记是一款隐私优先的个人知识管理系统,支持完全离线使用,同时也支持端到端加密同步。

    融合块、大纲和双向链接,重构你的思维。

    18132 引用 • 66897 回帖
  • JWT

    JWT(JSON Web Token)是一种用于双方之间传递信息的简洁的、安全的表述性声明规范。JWT 作为一个开放的标准(RFC 7519),定义了一种简洁的,自包含的方法用于通信双方之间以 JSON 的形式安全的传递信息。

    20 引用 • 15 回帖 • 18 关注
  • Gitea

    Gitea 是一个开源社区驱动的轻量级代码托管解决方案,后端采用 Go 编写,采用 MIT 许可证。

    4 引用 • 16 回帖 • 7 关注
  • 持续集成

    持续集成(Continuous Integration)是一种软件开发实践,即团队开发成员经常集成他们的工作,通过每个成员每天至少集成一次,也就意味着每天可能会发生多次集成。每次集成都通过自动化的构建(包括编译,发布,自动化测试)来验证,从而尽早地发现集成错误。

    14 引用 • 7 回帖
  • NGINX

    NGINX 是一个高性能的 HTTP 和反向代理服务器,也是一个 IMAP/POP3/SMTP 代理服务器。 NGINX 是由 Igor Sysoev 为俄罗斯访问量第二的 Rambler.ru 站点开发的,第一个公开版本 0.1.0 发布于 2004 年 10 月 4 日。

    311 引用 • 546 回帖 • 57 关注
  • Kafka

    Kafka 是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。 这种动作(网页浏览,搜索和其他用户的行动)是现代系统中许多功能的基础。 这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。

    35 引用 • 35 回帖
  • uTools

    uTools 是一个极简、插件化、跨平台的现代桌面软件。通过自由选配丰富的插件,打造你得心应手的工具集合。

    5 引用 • 13 回帖
  • Pipe

    Pipe 是一款小而美的开源博客平台。Pipe 有着非常活跃的社区,可将文章作为帖子推送到社区,来自社区的回帖将作为博客评论进行联动(具体细节请浏览 B3log 构思 - 分布式社区网络)。

    这是一种全新的网络社区体验,让热爱记录和分享的你不再感到孤单!

    131 引用 • 1114 回帖 • 153 关注
  • C

    C 语言是一门通用计算机编程语言,应用广泛。C 语言的设计目标是提供一种能以简易的方式编译、处理低级存储器、产生少量的机器码以及不需要任何运行环境支持便能运行的编程语言。

    83 引用 • 165 回帖 • 58 关注
  • CodeMirror
    1 引用 • 2 回帖 • 108 关注
  • jQuery

    jQuery 是一套跨浏览器的 JavaScript 库,强化 HTML 与 JavaScript 之间的操作。由 John Resig 在 2006 年 1 月的 BarCamp NYC 上释出第一个版本。全球约有 28% 的网站使用 jQuery,是非常受欢迎的 JavaScript 库。

    63 引用 • 134 回帖 • 744 关注
  • Eclipse

    Eclipse 是一个开放源代码的、基于 Java 的可扩展开发平台。就其本身而言,它只是一个框架和一组服务,用于通过插件组件构建开发环境。

    75 引用 • 258 回帖 • 625 关注
  • GitBook

    GitBook 使您的团队可以轻松编写和维护高质量的文档。 分享知识,提高团队的工作效率,让用户满意。

    3 引用 • 8 回帖 • 1 关注
  • etcd

    etcd 是一个分布式、高可用的 key-value 数据存储,专门用于在分布式系统中保存关键数据。

    5 引用 • 26 回帖 • 489 关注
  • 大数据

    大数据(big data)是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    89 引用 • 113 回帖
  • 数据库

    据说 99% 的性能瓶颈都在数据库。

    330 引用 • 612 回帖
  • Git

    Git 是 Linux Torvalds 为了帮助管理 Linux 内核开发而开发的一个开放源码的版本控制软件。

    204 引用 • 357 回帖 • 1 关注
  • 资讯

    资讯是用户因为及时地获得它并利用它而能够在相对短的时间内给自己带来价值的信息,资讯有时效性和地域性。

    53 引用 • 85 回帖 • 3 关注
  • 京东

    京东是中国最大的自营式电商企业,2015 年第一季度在中国自营式 B2C 电商市场的占有率为 56.3%。2014 年 5 月,京东在美国纳斯达克证券交易所正式挂牌上市(股票代码:JD),是中国第一个成功赴美上市的大型综合型电商平台,与腾讯、百度等中国互联网巨头共同跻身全球前十大互联网公司排行榜。

    14 引用 • 102 回帖 • 405 关注
  • FFmpeg

    FFmpeg 是一套可以用来记录、转换数字音频、视频,并能将其转化为流的开源计算机程序。

    22 引用 • 31 回帖 • 13 关注
  • Openfire

    Openfire 是开源的、基于可拓展通讯和表示协议 (XMPP)、采用 Java 编程语言开发的实时协作服务器。Openfire 的效率很高,单台服务器可支持上万并发用户。

    6 引用 • 7 回帖 • 87 关注
  • Maven

    Maven 是基于项目对象模型(POM)、通过一小段描述信息来管理项目的构建、报告和文档的软件项目管理工具。

    185 引用 • 318 回帖 • 353 关注
  • SpaceVim

    SpaceVim 是一个社区驱动的模块化 vim/neovim 配置集合,以模块的方式组织管理插件以
    及相关配置,为不同的语言开发量身定制了相关的开发模块,该模块提供代码自动补全,
    语法检查、格式化、调试、REPL 等特性。用户仅需载入相关语言的模块即可得到一个开箱
    即用的 Vim-IDE。

    3 引用 • 31 回帖 • 66 关注
  • Latke

    Latke 是一款以 JSON 为主的 Java Web 框架。

    70 引用 • 532 回帖 • 706 关注