Python爬虫实战:电影网的爬取

编程开发   © 文章版权由 admin 解释,禁止匿名转载

#楼主# 2022-4-3

目标:爬取飘风电影网

废话少说,上代码:

import requests
from lxml import etree
import re
import pandas as pd

#---------------------载入模块

requests=requests.get('

本帖含有隐藏内容,请您 回复 后查看
').text
html=etree.HTML(requests)

#--------------------获取网站信息,开始爬取!

film = html.xpath('//div/div[2]/div/div/div/ul/li/div/a/@title')
piay = html.xpath('//div/div[3]/div/div/div/ul/li/div/a/@title')
comic = html.xpath('//div/div[5]/div/div/div/ul/li/div/a/@title')

#------------------名字获取成功,接下来建立三个列表,分别储存三个系列的链接

film_list = []
piay_list = []
comic_list = []

link_top = '
本帖含有隐藏内容,请您 回复 后查看
play/'
link_bottom = '-1-1.html'

#------------建立列表成功,拼接链接基础完成。开始获取链接并通过正则表达式拼接链接!

film_link=html.xpath('//div/div[2]/div/div/div/ul/li/div/a/@href')
piay_link=html.xpath('//div/div[3]/div/div/div/ul/li/div/a/@href')
comic_link=html.xpath('//div/div[5]/div/div/div/ul/li/div/a/@href')
#-----------获取链接完成,开启拆卸拼接!
for i in film_link:
a = re.search('\d+',i)
speli = link_top+a.group()+link_bottom
film_list.append(speli)
for i in piay_link:
a = re.search('\d+',i)
speli = link_top+a.group()+link_bottom
piay_list.append(speli)
for i in comic_link:
a = re.search('\d+',i)
speli = link_top+a.group()+link_bottom
comic_list.append(speli)
#---------------------链接拼接完成!测试!测试完成!

#-------------------建立表格!
deta = {'电影名':film,'电影链接':film_list,'电视剧':piay,'电视剧链接':piay_list,'动漫名':comic,'动漫链接':comic_list}
df = pd.DataFrame(deta)

df.to_excel('电影爬取.xlsx')

如果没成功,那就是你没安装Python的模块。不会就问,我看到就教。

沙发
孤星孤月 2022-4-3
如果实在看不懂,那我有空一步一步解析。
板凳
LV是非 2022-4-3
请勿推广公众号
地板
LV是非 2022-4-3
无图无真相,如需补充帖子相关图片联系在线版主解锁。

评论

登录后才可发表内容
  • 主题

    2

  • 帖子

    30

  • 关注者

    0

Copyright © 2019 凯特网.   Powered by HYBBS 2.3.4  

Runtime:0.0909s Mem:2083Kb