前奏篇
正式编写爬虫学习前,以下内容先搞定:
能安装 Python 环境,例如安装 3.5 版本,可以切换为其他版本;
能熟练 Python 第三方库;
能运行 Python 脚本文件,能输出 hello world。
目标数据源分析
本次待抓取的目标地址为:
http://www.netbian.com/mei/index.htm

抓取目标:
抓取该网站的图片,目标 2000 张。
用到的 Python 框架为:
requests 库、re 模块
其它技术栈补充:
正则表达式
目标网站地址规则:
http://www.netbian.com/mei/index.htm
2.htm
3.htm
结论,列表页规则为
{页码}.htm
数据范围
累计 164 页;
每页 20 条数据。
图片所在标签与页面地址
图片所在标签位置代码如下:
陆萱萱 白色衬衫 裙子 职业装 美女模特壁纸页面地址为 /desk/23397.htm
整理需求如下
生成所有列表页 URL 地址;
遍历列表页 URL 地址,并获取图片详情页地址;
进入详情页获取大图;
保存图片;
得到 2000 张图片之后,开始欣赏。
代码实现时间
提前安装完毕 requests 模块,使用 pip install requests 即可,如果访问失败,切换国内 pip 源。
代码结构如下:
import requests
# 抓取函数
def main():
pass
# 解析函数
def format():
pass
# 存储函数
def save_image():
pass
if __name__ == '__main__':
main()
先实现 10 行代码抓美女图,举个例子,在正式开始前,需要略微了解一些前端知识与正则表达式知识。
例如通过开发者工具查看网页,得到图片素材都在
和
这两个标签中,首先要做的就是拆解字符串,取出目标数据部分

由于字数限制,后面代码放不下了,所以我写了个markdown文档:
完整源码下载:
3000美女壁纸下载:
密码:0110
举报 0