详解用python写网络爬虫-爬取新浪微博评论

更新时间：2019年05月10日 16:33:59 作者：Joliph

这篇文章主要介绍了python爬取新浪微博评论，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧

新浪微博需要登录才能爬取，这里使用m.weibo.cn这个移动端网站即可实现简化操作，用这个访问可以直接得到的微博id。

分析新浪微博的评论获取方式得知，其采用动态加载。所以使用json模块解析json代码

单独编写了字符优化函数，解决微博评论中的嘈杂干扰字符

本函数是用python写网络爬虫的终极目的，所以采用函数化方式编写，方便后期优化和添加各种功能

# -*- coding:gbk -*-
import re
import requests
import json
from lxml import html
#测试微博4054483400791767
comments=[]

def get_page(weibo_id):
  url='https://m.weibo.cn/status/{}'.format(weibo_id)
  html=requests.get(url).text
  regcount=r'"comments_count": (.*?),'
  comments_count=re.findall(regcount,html)[-1]
  comments_count_number=int(comments_count)
  page=int(comments_count_number/10)
  return page-1

def opt_comment(comment):
  tree=html.fromstring(comment)
  strcom=tree.xpath('string(.)')
  reg1=r'回复@.*?:'
  reg2=r'回覆@.*?:'
  reg3=r'//@.*'
  newstr=''
  comment1=re.subn(reg1,newstr,strcom)[0]
  comment2=re.subn(reg2,newstr,comment1)[0]
  comment3=re.subn(reg3,newstr,comment2)[0]
  return comment3

def get_responses(id,page):
  url="https://m.weibo.cn/api/comments/show?id={}&page={}".format(id,page)
  response=requests.get(url)
  return response

def get_weibo_comments(response):
  json_response=json.loads(response.text)
  for i in range(0,len(json_response['data'])):
    comment=opt_comment(json_response['data'][i]['text'])
    comments.append(comment)


weibo_id=input("输入微博id，自动返回前5页评论：")
weibo_id=int(weibo_id)
print('\n')
page=get_page(weibo_id)
for page in range(1,page+1):
  response=get_responses(weibo_id,page)
  get_weibo_comments(response)

for com in comments:
  print(com)
print(len(comments))

以上所述是小编给大家介绍的python爬取新浪微博评论详解整合，希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对脚本之家网站的支持！

您可能感兴趣的文章:

使用pyinstaller打包PySide2程序中遇到的问题
说到打包，我们就需要用到python程序的打包工具pyinstaller了,这个包安装简单,使用同样简单,下面这篇文章主要给大家介绍了关于使用pyinstaller打包PySide2程序中遇到的问题,需要的朋友可以参考下
2023-05-05
Python3去除头尾指定字符的函数strip()、lstrip()、rstrip()用法详解
这篇文章主要介绍了Python3去除头尾指定字符的函数strip()、lstrip()、rstrip()用法详解,需要的朋友可以参考下
2021-04-04
使用Python写一个量化股票提醒系统
这篇文章主要介绍了小白用Python写了一个股票提醒系统,迷你版量化系统，完美的实现了实时提醒功能，代码简单易懂，非常不错，具有一定的参考借鉴价值，需要的朋友可以参考下
2018-08-08
Python基于词频排序实现快速挖掘关键词
这篇文章主要为大家详细介绍了Python如何基于词频排序实现快速挖掘关键词功能，文中的示例代码讲解详细，感兴趣的小伙伴可以了解一下
2023-03-03
python使用pandas处理excel文件转为csv文件的方法示例
这篇文章主要介绍了python使用pandas处理excel文件转为csv文件的方法示例，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2019-07-07
Visual Studio Code搭建django项目的方法步骤
这篇文章主要介绍了Visual Studio Code搭建django项目的方法步骤，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-09-09
python怎么自定义捕获错误
在本篇文章里小编给大家分享了关于python自定义捕获错误的方法，需要的朋友们可以学习下。
2020-06-06
python套接字socket通信
这篇文章主要介绍了python套接字socket通信，python标准库中内置了底层网络接口socket，以下代码均默认from socket import *，下文很多详细内容需要的小伙伴可以参考一下
2022-04-04
python __init__与 __new__的区别
本文主要介绍了python __init__与 __new__的区别，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2023-02-02
Matlab读取excel并利用拉依达准则筛选数据的全过程
在Excel中录入好数据以后经常需要被matlab读取,具体该如何读取并进行筛选呢？下面这篇文章就来给大家介绍了关于Matlab读取excel并利用拉依达准则筛选数据的相关资料,需要的朋友可以参考下
2021-08-08

详解用python写网络爬虫-爬取新浪微博评论

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具