吉游网提供最新游戏下载和手游攻略!

Python全站漫画爬取指南:腾讯动漫详细教程与源码分享

发布时间:2024-10-19浏览:73

大家好,如果您还对Python全站漫画爬取指南:腾讯动漫详细教程与源码分享不太了解,没有关系,今天就由本站为大家分享Python全站漫画爬取指南:腾讯动漫详细教程与源码分享的知识,包括的问题都会给大家分析到,还望可以解决大家的问题,下面我们就开始吧!

操作环境

编译器:pycharm社区版

python 版本:anaconda python3.7.4

浏览器选择:Google浏览器

需要用到的第三方模块:requests , lxml , selenium , time , bs4,os

网页分析

明确目标

首先我们打开腾讯动漫首页,分析要抓取的目标漫画。找到腾讯动漫的漫画目录页,简单看了一下目录,发现全站的漫画数量超过了三千部(感觉就是爬下来也会把内存撑爆)

于是我觉得爬取首页的推荐漫画会是一个比较好的选择(爬取全站漫画只需要稍稍改一下网址构造就可以做到了)

提取漫画地址

选定了对象之后,就应该想办法来搞到漫画的地址了右击检查元素,粗略看一遍网页的源代码,这时我发现里面有很多连续的

标签,我猜测每部漫画的地址信息就存储在这些标签里面

随便打开一个《li》标签,点击里面包裹的链接地址会跳转到一个新的网页,这个网页正是我想要找的漫画地址,可以见得我的猜测是正确的,等到实际操作的时候再用表达式提取信息就非常容易了

提取漫画章节地址

进入漫画的目录页,发现一页最多可以展示20章的漫画目录,要想更换显示还需要点击章节名上面的选项卡来显示其他章节的地址

接下来就需要我们来检查网页元素想办法来获取章节地址了,同样右击检查元素在看到了源代码后,我发现了一个非常惊喜的事情,这个源码里面包含着所有的章节链接,而不是通过动态加载来展示的,这就省去了我们提取其他章节链接的功夫,只需要花心思提取漫画图片就可以了

这里每个《p》标签下包含了五个《a》标签,每个《li》标签下包含了四个《p》标签,而每个漫画的链接就存在每个《a》标签中,可以轻松通过语法来提取到每页的链接信息

提取漫画图片

怎么将漫画的图片地址提取出来并保存到本地,这是这个代码的难点和核心先是打开漫画,这个漫画页应该是被加上了某些措施,所以它没办法使用右键查看网页源代码,但是使用快捷键[ctrl + shift +i]是可以看到的

按下[ctrl + shift + i],检查元素

通过第一次检查,可以发现网页的元素中只有前几张图片的地址信息,后面的信息都为后缀.gif的文件表示,这些gif文件就是图片的加载动画

接着向下滑动到底部,等待图片全部显示出来再次检查元素

现在所有的漫画图片全部显示出来,下方并无.gif 的文件,由此可知,腾讯动漫是以js异步加载来显示图片的,要想获取页面的全部图片,就必须要滑动滚动条,将全部的图片加载完成再进行提取,这里我选择selenium模块和chromedriver来帮助我完成这些操作。下面开始进行代码的编写。

编写代码

导入需要的模块

import requestsfrom lxml import etreefrom selenium import webdriver #selenium模拟操作from time import sleepfrom bs4 import BeautifulSoupfrom selenium.webdriver.chrome.options import Options #谷歌无头浏览器import os

获取漫画地址

这里我使用的是xpath提取漫画地址信息,在谷歌浏览器中使用xpath helper插件辅助编写xpath表达式

#打开腾讯动漫首页url = 'https://ac.qq.com/'#给网页发送请求data = requests.get(url).text#将网页信息转换成xpath可识别的类型html = etree.HTML(data)#提取到每个漫画的目录页地址comic_list = html.xpath('//a[@class="in-rank-name"]/@href')print(comic_list)

print一下输出的comic_list,提取成功

提取漫画的内容页

内容页的提取也很简单,就像上面的分析一样,使用简单的xpath语法即可提取

然后我们再将漫画的名字提取出来,方便为保存的文件夹命名

#遍历提取到的信息for comic in comic_list: #拼接成为漫画目录页的网址 comic_url = url + str(comic) #从漫画目录页提取信息 url_data = requests.get(comic_url).text #准备用xpath语法提取信息 data_comic = etree.HTML(url_data) #提取漫画名--text()为提取文本内容 name_comic = data_comic.xpath("//h2[@class='works-intro-title ui-left']/strong/text()") #提取该漫画每一页的地址 item_list = data_comic.xpath("//span[@class='works-chapter-item']/a/@href") print(name_comic) print(item_list)

print打印的信息:

提取章节名

刚刚我们输出的是漫画页的地址字段,但是通过这些字段并不能请求到信息,还需在前面加上域名才可以构成一个完整的网址提取章节名是为了在漫画名的文件夹下再为每个章节创建一个文件夹保存漫画图片

for item in item_list: #拼接每一章节的地址 item_url = url + str(item) #print(item_url) #请求每一章节的信息 page_mes = requests.get(item_url).text #准备使用xpath提取内容 page_ming = etree.HTML(page_mes) #提取章节名 page_name = page_ming.xpath('//span[@class="title-comicHeading"]/text()') print(page_name)

打印章节名:

获取漫画源网页代码

这个部分的代码是这个代码的核心部分,也是花费时间最久的部分首先我们知道通过正常的方式没有办法请求到所有的图片地址信息,若是使用抓包方法会变得非常难分析,所以我采用的是模拟浏览器滑动的方法来获得图片的地址信息为了方便看到结果,先将webdriver设置为有界面模式,等到实现想要的功能之后,再将它隐藏起来

#webdriver位置 path = r'/home/jmhao/chromedriver' #浏览器参数设置 browser = webdriver.Chrome(executable_path=path) #开始请求第一个章节的网址 browser.get(item_url) #设置延时,为后续做缓冲 sleep(2) #尝试执行下列代码 try: #设置自动下滑滚动条操作 for i in range(1, 100): #滑动距离设置 js = 'var q=document.getElementById("mainView").scrollTop = ' + str(i * 1000) #执行滑动选项 browser.execute_script(js) #延时,使图片充分加载 sleep(2) sleep(2) #将打开的界面截图保存,证明无界面浏览器确实打开了网页 browser.get_screenshot_as_file(str(page_name) + ".png") #获取当前页面源码 data = browser.page_source #在当前文件夹下创建html文件,并将网页源码写入 fh = open("dongman.html", "w", encoding="utf-8") #写入操作 fh.write(data) #关掉浏览器 fh.close() # 若上述代码执行报错(大概率是由于付费漫画),则执行此部分代码 except Exception as err: #跳过错误代码 pass

运行之后会自动打开漫画的内容页,并拖动右侧的滑动条(模拟了手动操作,缓慢拖动是为了让图片充分加载),其中的sleep方法和网速有一定的关系,网速好的可以适当减少延时的时间,网速差可适当延长在写拖动滑动条的代码时,我尝试了非常多种拖动写法,也模拟了按下方向键的操作,可是只有这一种方法使用成功了。我认为失败的原因可能是刚打开界面的时候会有一个导航条挡住滑块,导致无法定位到滑块的坐标(因为我用其他网页测试的时候都是可以拖动的)

使用的try是为了防止有一些章节会弹出付费窗口,导致程序报错,使后续无法运行,即遇到会报错的情况就跳过此段代码,执行except中的选项

这段程序运行完之后有一个dongman.html文件保存在当前文件夹下,里面就包含了所有图片的url,接下来只要读取这个文件的内容就可以提取到所有的漫画地址了

下载漫画图片

当我们保存完网页的源代码之后,接下来的操作就变得简单了 我们要做的就是提取文件内容,将图片下载到本地

#用beautifulsoup打开本地文件 html_new = BeautifulSoup(open('dongman.html', encoding='utf-8'), features='html.parser') #提取html文件中的主体部分 soup = html_new.find(id="mainView") #设置变量i,方便为保存的图片命名 i = 0 #提取出主体部分中的img标签(因为图片地址保存在img标签中) for items in soup.find_all("img"): #提取图片地址信息 item = items.get("src") #请求图片地址 comic_pic = requests.get(item).content #print(comic_pic) #尝试提取图片,若发生错误则跳过 try: #打开文件夹,将图片存入 with open('comic/' + str(name_comic) + '/' + str(page_name) + '/' + str(i + 1) + '.jpg', 'wb') as f: #print('正在下载第 ', (i + 1), ' 张图片中') print('正在下载' , str(name_comic) , '-' , str(page_name) , '- 第' , (i+1) , '张图片') #写入操作 f.write(comic_pic) #更改图片名,防止新下载的图片覆盖原图片 i += 1 #若上述代码执行报错,则执行此部分代码 except Exception as err: #跳过错误代码 pass

下载结果

到了这里代码就写完了,来看一下运行结果:

打开文件夹看到:

完整代码

用户评论

孤败

终于找到了完整的教程!我之前一直想要学习爬虫,尤其是关于腾讯动漫的爬取一直是目标内容。有了这份教程和源码,相信自己入门之后就能轻松搞定啦!

    有19位网友表示赞同!

抚涟i

图文清晰讲解,语言也很易懂,作为一个Python初学者,也能跟着做一遍。 强烈推荐给正在学习爬虫的朋友们,简直太棒了!

    有5位网友表示赞同!

又落空

下载下来一看,源码逻辑结构清晰,注释也很到位。作者的思路很明智,把腾讯动漫的网站结构分析得非常透彻。点赞!赞一个!

    有12位网友表示赞同!

稳妥

教程分享的很棒!我一直想找一本关于Python爬取漫画资源的书籍,没想到这篇文章竟然满足了我的需求。希望大家多关注原创内容啊!

    有19位网友表示赞同!

浮殇年华

我下载下来看了一下源码,感觉有些地方写的代码比较简陋。可能是为了方便入门,所以没有过于复杂的逻辑? 希望能更新一些更完善的版本,加入更多的功能和优化

    有20位网友表示赞同!

见朕骑妓的时刻

虽然教程很详细,但我还是遇到了些小问题。估计是我Python基础比较薄弱吧…… 建议作者能加上一份常见问题解答或者论坛连接,这样初学者就能更快地解决遇到的困难。

    有14位网友表示赞同!

疲倦了

这个教程应该是在测试环境下写的代码吧? 我按照教程步骤执行,结果总是报错说某个元素不存在… 感觉网站结构可能发生了一些变化,需要更新一下源代码

    有5位网友表示赞同!

绝版女子

爬取漫画数据其实很有潜力,可以进行一些更深层次的分析,比如用户的阅读喜好、不同类型漫画的受欢迎程度等等。希望大家能利用这个工具创造出更多有价值的内容!

    有6位网友表示赞同!

花开丶若相惜

太棒了!终于可以方便地收集自己喜欢的漫画资源啦!之前总是需要手动下载,真是太麻烦了…… 这个教程拯救了我!

    有5位网友表示赞同!

权诈

爬取漫画数据要注意合法性问题吧,不要侵犯到版权方的利益。希望大家在使用这个工具的同时也要遵守相关的法律法规

    有9位网友表示赞同!

花花世界总是那么虚伪﹌

这个教程太棒啦! 我一直都在找类似的教程,没想到你分享了这么好的资源! 真的感谢你的辛苦付出!

    有18位网友表示赞同!

龙吟凤

看了下评论区,好像很多人都是新手爬虫小白,我也是…… 希望能有更多耐心解答大家的疑问和问题,共同进步吧!

    有8位网友表示赞同!

爱你心口难开

说起来我最近在学习Python爬虫,正好想了解腾讯动漫的网站结构。这个教程看起来很有用处,我要试试看能不能顺利爬取一些喜欢的漫画!

    有18位网友表示赞同!

墨城烟柳

下载源码后,发现依赖了一些其他的库文件,还需要额外安装才能运行。建议作者能包含所有所需的库列表以及操作步骤,方便新手学习使用

    有8位网友表示赞同!

信仰

如果可以添加一些错误处理机制和数据校验功能,该教程就更完美了!这样即使遇到一些异常情况也能及时处理,避免程序崩溃或者数据丢失。

    有15位网友表示赞同!

沐晴つ

这个Python爬取腾讯动漫全站漫画详细教程还蛮适合学习使用Python的人群来说吧,特别是对于想进行网站爬取、数据挖掘的用户来说相当实用!

    有10位网友表示赞同!

断秋风

虽然我之前接触过一些python爬虫知识,但这个教程还是很有帮助的。作者把整个流程讲解得很清楚,而且代码简洁易懂,非常适合初学者跟着学!

    有7位网友表示赞同!

墨染殇雪

感觉这个教程可以做一个持续更新版本, 及时根据腾讯动漫网站的结构变化调整代码,这样就能保证教程长期适用,帮助更多的人学习到爬虫知识

    有6位网友表示赞同!

何必锁我心

我一直以为爬取漫画资源需要一些专业技术才能实现,没想到还是可以借助Python和这个教程轻松搞定!真是太厉害了!

    有6位网友表示赞同!

热点资讯