Python 制作糗事百科爬虫实例

更新时间：2016年09月22日 08:41:41 作者：千里追风

本文是结合前面的三篇关于python制作爬虫的基础文章，给大家分享的一份爬取糗事百科的小段子的源码，有需要的小伙伴可以参考下

早上起来闲来无事做，莫名其妙的就弹出了糗事百科的段子，转念一想既然你送上门来，那我就写个爬虫到你网站上爬一爬吧，一来当做练练手，二来也算找点乐子。

其实这两天也正在接触数据库的内容，可以将爬取下来的数据保存在数据库中，以待以后的利用。好了，废话不多说了，先来看看程序爬取的数据结果

值得一提的是，我在程序中想一下子爬取糗事百科 30 页的内容，但是出现了连接错误，当我把页数降到 20 页的时候，程序就可以正常的跑起来了，不知道是什么原因，渴望知道的大神可以告诉我一声，感激不尽。

程序非常简单，直接上源代码咯

# coding=utf8

import re
import requests
from lxml import etree
from multiprocessing.dummy import Pool as ThreadPool
import sys

reload(sys)
sys.setdefaultencoding('utf-8')


def getnewpage(url, total):
 nowpage = int(re.search('(\d+)', url, re.S).group(1))
 urls = []

 for i in range(nowpage, total + 1):
  link = re.sub('(\d+)', '%s' % i, url, re.S)
  urls.append(link)

 return urls


def spider(url):
 html = requests.get(url)
 selector = etree.HTML(html.text)

 author = selector.xpath('//*[@id="content-left"]/div/div[1]/a[2]/@title')
 content = selector.xpath('//*[@id="content-left"]/div/div[2]/text()')
 vote = selector.xpath('//*[@id="content-left"]/div/div[3]/span/i/text()')

 length = len(author)
 for i in range(0, length):
  f.writelines('作者 : ' + author[i] + '\n')
  f.writelines('内容 ：' + str(content[i]).replace('\n','') + '\n')
  f.writelines('支持 ： ' + vote[i] + '\n\n')


if __name__ == '__main__':

 f = open('info.txt', 'a')
 url = 'http://www.qiushibaike.com/text/page/1/'
 urls = getnewpage(url, 20)

 pool = ThreadPool(4)
 pool.map(spider,urls)
 f.close()

如果其中有不懂得部分，可以依次参考我的前三篇文章。

您可能感兴趣的文章:

Python SVM(支持向量机)实现方法完整示例
这篇文章主要介绍了Python SVM(支持向量机)实现方法,结合完整实例形式分析了基于Python实现向量机SVM算法的具体步骤与相关操作注意事项,需要的朋友可以参考下
2018-06-06
Pygame与OpenCV联合播放视频并保证音画同步
Pygame的Movie模块已经废弃多年，本文主要介绍了Pygame与OpenCV联合播放视频并保证音画同步，文中通过示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2021-12-12
Python yield 小结和实例
yield的作用就是把一个函数变成一个 generator，带有 yield 的函数不再是一个普通函数，Python 解释器会将其视为一个 generator（不知道什么是generator要先去理解一下Python的generator的了）
2014-04-04
Python操作MongoDB增删改查代码示例
这篇文章主要介绍了Python操作MongoDB增删改查代码示例,需要的朋友可以参考下
2022-12-12
Python获取时间戳的几种方法详细示例
这篇文章主要给大家介绍了关于Python获取时间戳的几种方法,时间戳通常是一个字符序列,唯一地标识某一刻的时间,文中通过代码示例介绍的非常详细,需要的朋友可以参考下
2023-10-10
详解pycharm连接远程linux服务器的虚拟环境的方法
这篇文章主要介绍了pycharm连接远程linux服务器的虚拟环境的详细教程,本文通过图文并茂的形式给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2020-11-11
Python随机数种子(random seed)的使用
在科学技术和机器学习等其他算法相关任务中，我们经常需要用到随机数，本文就详细的介绍一下Python随机数种子，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2021-07-07
python保存字典和读取字典的实例代码
这篇文章主要介绍了python保存字典和读取字典的实例代码,通过代码给大家介绍了python 使用列表和字典存储信息的相关代码，需要的朋友可以参考下
2019-07-07
python并发编程 Process对象的其他属性方法join方法详解
这篇文章主要介绍了python并发编程 Process对象的其他属性方法join方法详解,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2019-08-08
python中内置函数range详解
Python内置函数range()是一个用于生成一系列连续的整数的函数，它常用于循环结构中，用于指定循环的次数或迭代的范围，这篇文章主要介绍了python之内置函数range,需要的朋友可以参考下
2023-07-07

Python 制作糗事百科爬虫实例

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具