Python3获取拉勾网招聘信息的方法实例

更新时间：2019年04月03日 09:08:54 作者：Max_Lyu

这篇文章主要给大家介绍了关于Python3获取拉勾网招聘信息的相关资料，文中通过示例代码介绍的非常详细，对大家学习或者使用Python3具有一定的参考学习价值，需要的朋友们下面来一起学习学习吧

前言

为了了解跟python数据分析有关行业的信息，大概地了解一下对这个行业的要求以及薪资状况，我决定从网上获取信息并进行分析。既然想要分析就必须要有数据，于是我选择了拉勾，冒着危险深入内部，从他们那里得到了信息。不得不说，拉勾的反爬技术还挺厉害的，稍后再说明。话不多说，直接开始。

一、明确目的

每次爬虫都要有明确的目的，刚接触随便找东西试水的除外。我想要知道的是python数据分析的要求以及薪资状况，因此，薪资、学历、工作经验以及一些任职要求就是我的目的。

既然明确了目的，我们就要看一下它们在什么位置，所以我们打开浏览器，寻找目标。像拉勾这种网站他们的信息一般都是通过ajax加载的，而且在输入“python数据分析”敲击回车之后跳转的页面，招聘信息不是一开始就显示出来的，通过点击页码也只是招聘信息在变化甚至连network都没多大变化，可以大胆猜测他是通过post请求的，所以我们只关注post请求以及XHR文件，很快就发现了我们要的东西。

点击preview可见详细信息以json形式保存着，其中‘salary'、‘workYear'、‘education'、‘positionID'（招聘信息详情页有关的id）是我们要的。再观察一下它的form data，其中kd=关键字，pn=pageNum（页码）这是我们请求的时候要带上的参数。另外我们要注意请求头的referer参数，待会儿要用。知道了目标之后，爬起来！

二、开始爬虫

先设置请求头headers，把平时用的user-agent带上，再把formdata也带上，用requests库直接requests.post(url, headers=headers, data=formdata) ，然后就开始报错了： {"status":false,"msg":"您操作太频繁,请稍后再访问","clientIp":"......","state":2402}。

解决这个问题的关键在于，了解拉勾的反爬机制：在进入python数据分析招聘页之前，我们要在主页，不妨叫它start_url输入关键字跳转。在这个过程中，服务器会传回来一个cookies，如果带着这个cookies请求的话我们就可以得到要的东西，所以要先请求start_url获取cookies在请求目标url，而且在请求目标地址的话还要带上referer这个请求头参数，referer的含义大概是这样：告诉服务器我是从哪个页面链接过来的，服务器基此可以获得一些信息用于处理。另外，睡眠时间也要设置的长一点，不然很容易被封。知道了反爬机制之后，话不多说，直接上代码。

'''
@author: Max_Lyu
Create time: 2019/4/1
url: https://github.com/MaxLyu/Lagou_Analyze
'''
 # 请求起始 url 返回 cookies
 def get_start_url(self):
 session = requests.session()
 session.get(self.start_url, headers=self.headers, timeout=3)
 cookies = session.cookies
 return cookies

 # 将返回的 cookies 一起 post 给 target_url 并获取数据
 def post_target_url(self):
 cookies = self.get_start_url()
 pn = 1
 for pg in range(30):
  formdata = {
  'first': 'false',
  'pn': pn,
  'kd': 'python数据分析'
  }
  pn += 1

  response = requests.post(self.target_url, data=formdata, cookies=cookies, headers=self.headers, timeout=3)
  self.parse(response)
  time.sleep(60) # 拉勾的反扒技术比较强，短睡眠时间会被封

 # 解析 response，获取 items
 def parse(self, response):
 print(response)
 items = []
 print(response.text)
 data = json.loads(response.text)['content']['positionResult']['result']

 if len(data):
  for i in range(len(data)):
  positionId = data[i]['positionId']
  education = data[i]['education']
  workYear = data[i]['workYear']
  salary = data[i]['salary']
  list = [positionId, education, workYear, salary]
  items.append(list)
 self.save_data(items)
 time.sleep(1.3)

其中save_data(items)是保存文件，我是保存在csv文件。篇幅有限，这里就不展示了。

三、获取招聘详情

上面说了positionID 是为了获取详情页，详情页里面有要的任职要求。这个要获取就相对容易了，不过文本的处理并没有很简单，我只能通过“要求”这两个字获取任职要求（虽然有的为任职技能啥的，就这样进行取舍了）。

'''
@author: Max_Lyu
Create time: 2019/4/1
url: https://github.com/MaxLyu/Lagou_Analyze
'''
def get_url():
 urls = []
 with open("analyst.csv", 'r', newline='') as file:
 # 读取文件
 reader = csv.reader(file)
 for row in reader:
  # 根据 positionID 补全 url
  if row[0] != "ID":
  url = "https://www.lagou.com/jobs/{}.html".format(row[0])
  urls.append(url)

 file.close()
 return urls

# 获取详细信息
def get_info():
 urls = get_url()
 length = len(urls)
 for url in urls:
 print(url)
 description = ''
 print(length)
 response = requests.get(url, headers=headers)
 response.encoding = 'utf-8'
 content = etree.HTML(response.text)
 detail = content.xpath('//*[@id="job_detail"]/dd[2]/div/p/text()')
 print(detail)

 for i in range(1, len(detail)):

  if '要求' in detail[i-1]:
  for j in range(i, len(detail)):
   detail[j] = detail[j].replace('\xa0', '')
   detail[j] = re.sub('[、;；.0-9。]', '', detail[j])
   description = description + detail[j] + '/'
  print(description)
 write_file(description)
 length -= 1
 time.sleep(3)

四、成果与展示

到这里，爬取的任务就结束了，源码地址：https://github.com/MaxLyu/Lagou_Analyze （本地下载）。获得数据之后就是小小地分析一下了，这个下次再总结。

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，谢谢大家对脚本之家的支持。

您可能感兴趣的文章:

python生成词云的实现方法(推荐)
下面小编就为大家带来一篇python生成词云的实现方法(推荐)。小编觉得挺不错的，现在就分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2017-06-06
浅谈Python响应式类库RxPy
RxPy是非常流行的响应式框架Reactive X的Python版本，其实这些版本都是一样的，只不过是各个语言的实现不同而已。因此，如果学会了其中一种，那么使用其他的响应式版本也是轻而易举的
2021-06-06
利用python pywifi实现破解WiFi密码
家里没有怎么办,只要你会Python,办法总比困难多,本文就利用pywifi 这个库实验一下如何破解Wi-Fi 密码,注意,该方法仅可用来研究学习所用,需要的朋友可以参考下
2024-03-03
Python编程实现蚁群算法详解
这篇文章主要介绍了Python编程实现蚁群算法详解，涉及蚂蚁算法的简介，主要原理及公式，以及Python中的实现代码，具有一定参考价值，需要的朋友可以了解下。
2017-11-11
详解如何在Django项目中使用Jinja2模板引擎
Django是一个强大的Python Web框架,它提供了一个内置的模板引擎,然而,在某些场景中,开发者可能倾向于使用更快、更灵活的模板引擎,比如Jinja2,在本文中,我们将详细探讨如何在Django项目中使用Jinja2模板引擎,并提供丰富的示例
2023-11-11
全网非常详细的pytest配置文件
本文主要介绍了全网非常详细的pytest配置文件，pytest的主配置文件，可以改变pytest的默认行为，有很多可配置的选项，感兴趣的可以了解一下
2022-07-07
Python爬虫实例之2021猫眼票房字体加密反爬策略(粗略版)
这篇文章主要介绍了Python爬虫实例之2021猫眼票房字体加密反爬策略(粗略版),本文给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2021-02-02
利用Python计算KS的实例详解
这篇文章主要介绍了利用Python计算KS的实例详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-03-03
使用Python进行网络数据可视化的多种方法与技巧
可视化是理解和解释大量数据的强大工具之一,而Python作为一种流行的编程语言,提供了丰富的库和工具来进行网络数据可视化,本文将介绍一些使用Python进行网络数据可视化的方法与技巧,并提供相应的代码实例,需要的朋友可以参考下
2024-05-05
Pandas 如何处理DataFrame中的inf值
这篇文章主要介绍了Pandas 如何处理DataFrame中的inf值，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教
2022-05-05

Python3获取拉勾网招聘信息的方法实例

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具