【彼岸之笙】用Pytho爬取3000张美女壁纸

编程开发   © 文章版权由 admin 解释,禁止匿名转载

#楼主# 2021-7-30

前奏篇
正式编写爬虫学习前,以下内容先搞定:

能安装 Python 环境,例如安装 3.5 版本,可以切换为其他版本;
能熟练 Python 第三方库;
能运行 Python 脚本文件,能输出 hello world。
目标数据源分析
本次待抓取的目标地址为:
http://www.netbian.com/mei/index.htm

抓取目标:
抓取该网站的图片,目标 2000 张。

用到的 Python 框架为:
requests 库、re 模块

其它技术栈补充:
正则表达式

目标网站地址规则:
http://www.netbian.com/mei/index.htm

本帖含有隐藏内容,请您 回复 后查看
2.htm
本帖含有隐藏内容,请您 回复 后查看
3.htm
结论,列表页规则为
本帖含有隐藏内容,请您 回复 后查看
{页码}.htm
数据范围
累计 164 页;
每页 20 条数据。
图片所在标签与页面地址
图片所在标签位置代码如下:
  • 陆萱萱 白色衬衫  裙子 职业装 美女模特壁纸陆萱萱 白色衬衫 裙子 职业装 美女模特壁纸

  • 页面地址为 /desk/23397.htm

    整理需求如下
    生成所有列表页 URL 地址;
    遍历列表页 URL 地址,并获取图片详情页地址;
    进入详情页获取大图;
    保存图片;
    得到 2000 张图片之后,开始欣赏。
    代码实现时间
    提前安装完毕 requests 模块,使用 pip install requests 即可,如果访问失败,切换国内 pip 源。

    代码结构如下:

    import requests

    # 抓取函数
    def main():
    pass

    # 解析函数
    def format():
    pass

    # 存储函数
    def save_image():
    pass

    if __name__ == '__main__':
    main()
    先实现 10 行代码抓美女图,举个例子,在正式开始前,需要略微了解一些前端知识与正则表达式知识。

    例如通过开发者工具查看网页,得到图片素材都在
    这两个标签中,首先要做的就是拆解字符串,取出目标数据部分

    由于字数限制,后面代码放不下了,所以我写了个markdown文档:

    本帖含有隐藏内容,请您 回复 后查看


    完整源码下载:
    本帖含有隐藏内容,请您 回复 后查看


    3000美女壁纸下载:
    本帖含有隐藏内容,请您 回复 后查看
    密码:0110

    11楼
    NB微凉 2021-8-1
    你不是NB的咋挂着NB的团徽[滑稽]
    12楼
    NB微凉 2021-8-1
    我这么垃圾你取关我吧[滑稽][玫瑰]
    我专门关注的你们不NB团队的人,专门找你们团队里有问题的
    请问我名字里有拿2个字?
    而且我也不会再在技术分享发帖了,我自己买域名自己搭建了个博客

    15楼
    唯聪只你 2021-8-1
    可以抓小程序吗
    1 2

    评论

    登录后才可发表内容
    • 主题

      23

    • 帖子

      327

    • 关注者

      0

    Copyright © 2019 凯特网.   Powered by HYBBS 2.3.4  

    Runtime:0.0658s Mem:2121Kb