本文为爬虫系列持久化先导篇,方便读者零基础入门mongodb,但想要真正灵活运用,还需要不断的学习和实践
这篇文章暂时【不涉及】爬虫,而是持久化的科普
不过写这篇文章时,大数据爬取已经写差不多了,为了方便小白入门,先行推出本文,其余文章近期就会发布,这篇算额外拓展了
【目录】
出于更新频率考虑,除了第一篇(前言)和最后一篇,其余文章的目录【不作】实时更新
✨前言
#【原创】爬虫的“正确”使用方式#
✨持续更新中...
————正文分隔线————
数据持久化,说白了就是通过数据库或其他存储方式,【长时间】保存数据
我们在爬虫过程中爬取的原数据和分析的结果数据,都是先保存在内存(变量)中的,这样一旦程序执行完毕或者终止,数据就全【丢失】了,并且对于大数据的处理是相对耗时的过程,已经分析过的数据没必要重复分析,仅使用变量暂存是远远不够的
并且很多时候我们需要保留处理的结果,并且能进行分类和检索,这时候就需要用到数据库了
⭐本文使用mongo,各位如果有自己趁手的数据库可以自行更改,不过py操作不同数据库的驱动也不大相同,需要针对性学习一下
本文为先导,相当于查缺补漏和快速入门,【不会】介绍py如何操作数据库,这个留到后面的章节
⭐为什么选择mongo?
❶轻量级,操作便利,入门简单
❷no sql架构,使用键值对结构,更符合py用户
❸数据结构自由,约束少,自由发挥空间大
❹感兴趣可自行百度更多内容...
我觉得至少前端和py爱好者会更喜欢mongo这类的no sql架构数据库
【基础科普】
⭐关系型数据库和非关系型数据库
关系型数据库(RDBMS)类似mysql这类,整个库结构类似【一张表】,一个字段就像表格中的一行,属性就是每个表格单元的值
而非关系型数据库(no sql)类似mongodb,redis这类,一般以【键值对】为基本结构,(什么是键值对?就是一个“键”能对应一个“值”的数据结构,例如py中的字典),当下最常见的json就是一种键值对
⭐mongo的数据结构
mongo使用“bson”的格式存储数据,简单来说就是【二进制】形式的json
最上层是数据库(database),然后是集合(collection)相当于一张数据表,最后是文档(document)相当于一个字段,是mongo中的【最小】储存单位,格式为bson
⭐下载与安装
下载时建议选择【4.0+】的版本,会省去很多事(例如配置环境变量)
安装教程很简单,基本上从官网找到安装包,打开后第一个选项选【最后一个】即自定义,然后一直下一步,除了要再选个安装目录,其他默认就行
然后就可以开始正式讲增删改查了(作为一个爬虫项目,我们只需要了解这四个操作就够用了)
⭐增加
前文说过了,mongo【不需要】提前创建数据结构,例如mysql,在插入数据前一定要先建表和数据库
但是mongo不需要,当你第一次向不存在的集合插入数据时,就能自动创建完毕
基本语法为:
举报 0