【彼岸之笙】用Pytho爬取3000张美女壁纸

编程开发   © 文章版权由 admin 解释,禁止匿名转载

#楼主# 2021-7-30

前奏篇
正式编写爬虫学习前,以下内容先搞定:

能安装 Python 环境,例如安装 3.5 版本,可以切换为其他版本;
能熟练 Python 第三方库;
能运行 Python 脚本文件,能输出 hello world。
目标数据源分析
本次待抓取的目标地址为:
http://www.netbian.com/mei/index.htm

抓取目标:
抓取该网站的图片,目标 2000 张。

用到的 Python 框架为:
requests 库、re 模块

其它技术栈补充:
正则表达式

目标网站地址规则:
http://www.netbian.com/mei/index.htm

本帖含有隐藏内容,请您 回复 后查看
2.htm
本帖含有隐藏内容,请您 回复 后查看
3.htm
结论,列表页规则为
本帖含有隐藏内容,请您 回复 后查看
{页码}.htm
数据范围
累计 164 页;
每页 20 条数据。
图片所在标签与页面地址
图片所在标签位置代码如下:
  • 陆萱萱 白色衬衫  裙子 职业装 美女模特壁纸陆萱萱 白色衬衫 裙子 职业装 美女模特壁纸

  • 页面地址为 /desk/23397.htm

    整理需求如下
    生成所有列表页 URL 地址;
    遍历列表页 URL 地址,并获取图片详情页地址;
    进入详情页获取大图;
    保存图片;
    得到 2000 张图片之后,开始欣赏。
    代码实现时间
    提前安装完毕 requests 模块,使用 pip install requests 即可,如果访问失败,切换国内 pip 源。

    代码结构如下:

    import requests

    # 抓取函数
    def main():
    pass

    # 解析函数
    def format():
    pass

    # 存储函数
    def save_image():
    pass

    if __name__ == '__main__':
    main()
    先实现 10 行代码抓美女图,举个例子,在正式开始前,需要略微了解一些前端知识与正则表达式知识。

    例如通过开发者工具查看网页,得到图片素材都在
    这两个标签中,首先要做的就是拆解字符串,取出目标数据部分

    由于字数限制,后面代码放不下了,所以我写了个markdown文档:

    本帖含有隐藏内容,请您 回复 后查看


    完整源码下载:
    本帖含有隐藏内容,请您 回复 后查看


    3000美女壁纸下载:
    本帖含有隐藏内容,请您 回复 后查看
    密码:0110

    板凳
    Ghost 2021-7-30
    前排等吃瓜。
    4楼
    玖月๑ 2021-7-30
    彼岸桌面真是经常被爬啊
    6楼
    氷羽藍汐 2021-7-30
    这小姐姐针不戳[滑稽]
    [滑稽][大拇指]那就给我github项目一个star吧[滑稽]
    8楼
    氷羽藍汐 2021-7-30
    下次一定[滑稽]
    10楼
    NB微凉 2021-8-1
    嘤嘤嘤,哥哥好凶[呵呵]

    评论

    登录后才可发表内容
    • 主题

      23

    • 帖子

      327

    • 关注者

      0

    Copyright © 2019 凯特网.   Powered by HYBBS 2.3.4  

    Runtime:0.1494s Mem:2149Kb