目标:爬取飘风电影网
废话少说,上代码:
import requests
from lxml import etree
import re
import pandas as pd
#---------------------载入模块
requests=requests.get('
').text
html=etree.HTML(requests)
#--------------------获取网站信息,开始爬取!
film = html.xpath('//div/div[2]/div/div/div/ul/li/div/a/@title')
piay = html.xpath('//div/div[3]/div/div/div/ul/li/div/a/@title')
comic = html.xpath('//div/div[5]/div/div/div/ul/li/div/a/@title')
#------------------名字获取成功,接下来建立三个列表,分别储存三个系列的链接
film_list = []
piay_list = []
comic_list = []
link_top = '
play/'
link_bottom = '-1-1.html'
#------------建立列表成功,拼接链接基础完成。开始获取链接并通过正则表达式拼接链接!
film_link=html.xpath('//div/div[2]/div/div/div/ul/li/div/a/@href')
piay_link=html.xpath('//div/div[3]/div/div/div/ul/li/div/a/@href')
comic_link=html.xpath('//div/div[5]/div/div/div/ul/li/div/a/@href')
#-----------获取链接完成,开启拆卸拼接!
for i in film_link:
a = re.search('\d+',i)
speli = link_top+a.group()+link_bottom
film_list.append(speli)
for i in piay_link:
a = re.search('\d+',i)
speli = link_top+a.group()+link_bottom
piay_list.append(speli)
for i in comic_link:
a = re.search('\d+',i)
speli = link_top+a.group()+link_bottom
comic_list.append(speli)
#---------------------链接拼接完成!测试!测试完成!
#-------------------建立表格!
deta = {'电影名':film,'电影链接':film_list,'电视剧':piay,'电视剧链接':piay_list,'动漫名':comic,'动漫链接':comic_list}
df = pd.DataFrame(deta)
df.to_excel('电影爬取.xlsx')
如果没成功,那就是你没安装Python的模块。不会就问,我看到就教。
举报 0