Scrapy模拟登录赶集网的实现代码

更新时间：2020年07月07日 10:06:52 作者：人丑就要多读书-Wu

这篇文章主要介绍了Scrapy模拟登录赶集网的实现代码，本文通过代码图文相结合给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下

1.打开赶集网登录界面，先模拟登录并抓包，获得post请求的request参数

2. 我们只需构造出上面的参数传入formdata即可

参数分析：

　　setcookie：为自动登录所传的值，不勾选时默认为0。

　　__hash__值的分析：只需要查看response网页源代码即可，然后用正则表达式提取。

3.代码实现

1.workon到自己的虚拟环境 cmd切换到项目目录，输入scrapy startproject ganjiwangdenglu,然后就可以用pycharm打开该目录啦。

2.在pycharm terminal中输入scrapy ganji ganjicom 创建地址，如下为项目目录

3. 代码详情

import scrapy
import re

class GanjiSpider(scrapy.Spider):
  name = 'ganji'
  allowed_domains = ['ganji.com']
  start_urls = ['https://passport.ganji.com/login.php']

  def parse(self, response):
    hash_code = re.search(r'"__hash__":"(.+)"}', response.text).group(1) # 正则获取哈希
    img_url = 'https://passport.ganji.com/ajax.php?dir=captcha&module=login_captcha' # 验证码url
    yield scrapy.Request(img_url, callback=self.do_formdata, meta={'hash_code': hash_code}) # 发送获取验证码请求并保存验证码到本地

  def do_formdata(self, response):
    with open('yzm.jpg', 'wb') as f:
      f.write(response.body)
      # 验证码三种方案：1，保存下来手动输入，2，云打码，3 tesseract模块，在这里我们手动输入
    code = input('请输入验证码：')
    # 创建表单
    formdata = {
      'username': 'your_username',
      'password': 'your_password',
      'setcookie': '14',
      'checkCode': code,
      'next': '',
      'source': 'passport',
      '__hash__': response.request.meta['hash_code'] # meta是在respose.request中
    }
    login_url = "https://passport.ganji.com/login.php"
    yield scrapy.FormRequest(url=login_url, formdata=formdata, callback=self.after_login) # 发送登录请求

  def after_login(self, response):
    print(response.text)

4.终端输入scrapy carwl ganji 即可大功告成。

返回来的json字符串解析如下：

注：setting中的设置不在赘述。

总结

到此这篇关于Scrapy模拟登录赶集网的文章就介绍到这了,更多相关Scrapy登录赶集网内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

记录一下scrapy中settings的一些配置小结
这篇文章主要介绍了记录一下scrapy中settings的一些配置小结，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-09-09
利用Seaborn绘制20个精美的pairplot图
本文记录的使用seaborn绘制pairplot图，主要是用来显示两两变量之间的关系（线性或非线性，有无较为明显的相关关系等），感兴趣的可以了解一下
2022-07-07
深入解析python项目引用运行路径
这篇文章主要介绍了python项目引用运行路径的问题,本文给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2023-05-05
Python 操作MySQL详解及实例
这篇文章主要介绍了Python 操作MySQL详解及实例的相关资料,需要的朋友可以参考下
2017-04-04
python内存管理机制原理详解
这篇文章主要介绍了python内存管理机制原理详解,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2019-08-08
如何使用Python数据清洗库
数据清洗是数据处理过程中至关重要的一部分,本文主要介绍了如何使用Python数据清洗库,具有一定的参考价值,感兴趣的可以了解一下
2023-12-12
Python实现全局变量的两个解决方法
这篇文章主要介绍了Python实现全局变量的两个解决方法,需要的朋友可以参考下
2014-07-07
opencv 图像滤波(均值,方框,高斯,中值)
这篇文章主要介绍了opencv 图像滤波(均值,方框,高斯,中值),文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-07-07
python 实现的截屏工具
这篇文章主要介绍了python 如何实现一个截屏工具，帮助大家更好的理解和学习使用python，感兴趣的朋友可以了解下
2021-05-05
选择python进行数据分析的理由和优势
在本篇文章中小编给大家整理了关于选择python进行数据分析的理由和优势，对此有需要的朋友们可以跟着学习参考下。
2019-06-06

Scrapy模拟登录赶集网的实现代码

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具