【原创】【爬虫系列】大数据爬取与持久化

编程开发   © 文章版权由 admin 解释,禁止匿名转载

#楼主# 2023-2-23

你爬取过多大的数据?10万,100万或是更多?那么爬完又如何分析数据呢?分析完的数据又如何处理呢?

[彩虹]如果以上问题你都有明确清晰的答案,那么恭喜你,不需要看这篇文章了

而对此抱有疑惑的读者,相信这篇文章对你会有收获

【目录】
✨前言与基础使用
#【原创】爬虫的“正确”使用方式#
✨持久化入门
#【原创】【爬虫系列】持久化(MongoDB先导入门)#
✨大数据爬取
本文
✨数据分析
待续...

本文简单爬取某某同城的随机分类的1万数据,仅做学习交流使用

[灯泡]代码爬取的数据理论上是无上限的,只不过教程不需要太多数据,1万条妥妥够用了,更多的数据只是时间问题,对于一个教程来说是不必要的

在实战爬取时,要考虑诸多内容:

请求头,数据是否动态渲染,爬取选择器是否干净,页面结构是否经常变化等

首先不管什么爬虫,基本都要有这几步:

✨装配url
✨发送请求
✨获取数据
✨分析数据
✨持久化数据

不过出于程序稳定性考虑,部分项目会把收集数据和分析数据作为两个独立进程

[灯泡]本文默认读者已有基础mongodb的知识,如果完全没概念可以参考:
#【原创】【爬虫系列】持久化(MongoDB先导入门)#

那么让我们来分析下爬取链接的代码
详见【图一】【图二】【图三】

我们把每个商品分页的路径保存到数据库然后读取到channel_list中,然后读取出来,通过map遍历访问,再将获取的数据保存到数据库【图五】,最终效果如【图四】

[彩虹]下一章我们将对爬取的数据进行分析(前文也说过,为了程序稳定性,我们把分析和收集分离)

那么本文就到此结束啦[玫瑰]

[彩虹]pluie
[彩虹]2023-02-23

11楼
Pluie 2023-3-1
快速收集数据的一种方式吧,如果要严谨的定义可以看百度
12楼
茜儿草 2023-3-3
你帮我弄一下呗,本来这个网址就是违法,不敢报警的,他们盈利几百w美刀了
13楼
Pluie 2023-3-3
按你的描述这种网站基本都比较稳定,而且前端文件浏览器能直接下载,后端文件不属于爬虫范畴

请注意本文对爬虫的定义:收集数据的工具,与“逆向”工程是无关的,我个人也不做逆向或者攻击行为

同时这是一篇教程贴,除了问答不做过多的拓展哦[玫瑰]
怎么联系你
15楼
Pluie 2023-3-4
有疑问直接留言即可,不留联系方式,也暂时不接单哦
1 2

评论

登录后才可发表内容
  • 主题

    18

  • 帖子

    426

  • 关注者

    0

Copyright © 2019 凯特网.   Powered by HYBBS 2.3.4  

Runtime:1.0627s Mem:2115Kb