【原创】【爬虫系列】大数据爬取与持久化

编程开发   © 文章版权由 admin 解释,禁止匿名转载

#楼主# 2023-2-23

你爬取过多大的数据?10万,100万或是更多?那么爬完又如何分析数据呢?分析完的数据又如何处理呢?

[彩虹]如果以上问题你都有明确清晰的答案,那么恭喜你,不需要看这篇文章了

而对此抱有疑惑的读者,相信这篇文章对你会有收获

【目录】
✨前言与基础使用
#【原创】爬虫的“正确”使用方式#
✨持久化入门
#【原创】【爬虫系列】持久化(MongoDB先导入门)#
✨大数据爬取
本文
✨数据分析
待续...

本文简单爬取某某同城的随机分类的1万数据,仅做学习交流使用

[灯泡]代码爬取的数据理论上是无上限的,只不过教程不需要太多数据,1万条妥妥够用了,更多的数据只是时间问题,对于一个教程来说是不必要的

在实战爬取时,要考虑诸多内容:

请求头,数据是否动态渲染,爬取选择器是否干净,页面结构是否经常变化等

首先不管什么爬虫,基本都要有这几步:

✨装配url
✨发送请求
✨获取数据
✨分析数据
✨持久化数据

不过出于程序稳定性考虑,部分项目会把收集数据和分析数据作为两个独立进程

[灯泡]本文默认读者已有基础mongodb的知识,如果完全没概念可以参考:
#【原创】【爬虫系列】持久化(MongoDB先导入门)#

那么让我们来分析下爬取链接的代码
详见【图一】【图二】【图三】

我们把每个商品分页的路径保存到数据库然后读取到channel_list中,然后读取出来,通过map遍历访问,再将获取的数据保存到数据库【图五】,最终效果如【图四】

[彩虹]下一章我们将对爬取的数据进行分析(前文也说过,为了程序稳定性,我们把分析和收集分离)

那么本文就到此结束啦[玫瑰]

[彩虹]pluie
[彩虹]2023-02-23

沙发
Pluie 2023-2-23
【补充】由于一篇帖子只能引用五篇文章,所以可能目录的展示会进行微调
板凳
誓言走过 2023-3-1
老哥,可以爬网站吗,需要些东西
地板
茜儿草 2023-3-1
这个网站能不能弄源码https://deepsukebe.io/
4楼
Pluie 2023-3-1
咱不接爬虫,不过爬取过程有疑问倒可以来问问
5楼
Pluie 2023-3-1
浏览器F12打开控制台,选项点网络就有各种资源了,如果要后端文件那就超出爬虫的范围了,你得先摸进服务器,并且是违法的
6楼
誓言走过 2023-3-1
可是我下载不了库啊
7楼
Pluie 2023-3-1
如果外网连不上可以换国内镜像,这些百度也很多
8楼
誓言走过 2023-3-1
可以远程操作一下嘛,真的不太懂。。。
9楼
Pluie 2023-3-1
如果是零基础的话,B站很多教学视频,基本都会带你装环境,每个人时间都有限,这些一搜就有的基础操作还是自行完成吧[玫瑰]
10楼
昵称289400 2023-3-1
爬虫是干嘛的

评论

登录后才可发表内容
  • 主题

    18

  • 帖子

    426

  • 关注者

    0

Copyright © 2019 凯特网.   Powered by HYBBS 2.3.4  

Runtime:0.0640s Mem:2146Kb