Pyspark获取并处理RDD数据代码实例

更新时间：2020年03月27日 11:54:00 作者：落日峡谷

这篇文章主要介绍了Pyspark获取并处理RDD数据代码实例,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

弹性分布式数据集（RDD）是一组不可变的JVM对象的分布集，可以用于执行高速运算，它是Apache Spark的核心。

在pyspark中获取和处理RDD数据集的方法如下：

1. 首先是导入库和环境配置（本测试在linux的pycharm上完成）

import os
from pyspark import SparkContext, SparkConf
from pyspark.sql.session import SparkSession
os.environ["PYSPARK_PYTHON"]="/usr/bin/python3"
conf = SparkConf().setAppName('test_rdd')
sc = SparkContext('local', 'test', conf=conf)
spark = SparkSession(sc)

2. 然后，提供hdfs分区数据的路径或者分区表名

txt_File = r"hdfs://host:port/apps/hive/warehouse/数据库名.db/表名/分区名/part-m-00029.deflate" # part-m-00029.deflate
# txt_File = r"hdfs://host:port/apps/hive/warehouse/数据库名.db/表名" # hive table

3. sc.textFile进行读取，得到RDD格式数据<还可以用 spark.sparkContext.parallelize(data) 来获取RDD数据>，参数中还可设置数据被划分的分区数

txt_ = sc.textFile(txt_File)

4. 基本操作：

type(txt_)：显示数据类型，这时属于 'pyspark.rdd.RDD'
txt_.first()：获取第一条数据
txt_.take(2)：获取前2条数据，形成长度为2的list
txt_.take(2)[1].split('\1')[1]：表示获取前两条中的第[1]条数据（也就是第2条，因为python的索引是从0开始的），并以 '\1'字符分隔开（这要看你的表用什么作为分隔符的），形成list，再获取该list的第2条数据
txt_.map(lambda x:x.split('\1'))：使用lambda函数和map函数快速处理每一行数据，这里表示将每一行以 '\1'字符分隔开，每一行返回一个list；此时数据结构是：'pyspark.rdd.PipelinedRDD'
txt_.map(lambda x:(x, x.split('\1'))).filter(lambda y:y[0].startswith('北京'))：表示在返回 (x, x.split('\1')) 后，进行筛选filter，获取其中以 '北京' 开头的行，并按照相同格式（例如，这里是(x, x.split('\1'))格式，即原数据+分割后的列表数据）返回数据
txt_.collect()：返回所有RDD数据元素，当数据量很大时谨慎操作
txt_.toDF()：不能直接转成DataFrame格式，需要设置Schema

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持脚本之家。

您可能感兴趣的文章:

对python 树状嵌套结构的实现思路详解
今天小编就为大家分享一篇对python 树状嵌套结构的实现思路详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-08-08
numpy.reshape(-1,1)的具体使用
本文主要介绍了numpy.reshape(-1,1)的具体使用，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2022-07-07
浅谈python3.6的tkinter运行问题
今天小编就为大家分享一篇浅谈python3.6的tkinter运行问题，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-02-02
python dataframe获得指定行列简单例子
在DataFrame中取特定行列的数据是一个常见的操作,这篇文章主要给大家介绍了关于python dataframe获得指定行列的简单例子,需要的朋友可以参考下
2024-03-03
django中websocket的具体使用
本文主要介绍了django中websocket的具体使用，文中通过示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2022-01-01
对Python中一维向量和一维向量转置相乘的方法详解
今天小编就为大家分享一篇对Python中一维向量和一维向量转置相乘的方法详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-08-08
解决tensorflow添加ptb库的问题
今天小编就为大家分享一篇解决tensorflow添加ptb库的问题，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-02-02
OpenCV-Python实现凸包的获取
凸包是一个计算几何中的概念，在图像处理过程中，我们常常需要寻找图像中包围某个物体的凸包，本文就使用OpenCV实现，感兴趣的可以了解一下
2021-06-06
Python函数__new__及__init__作用及区别解析
这篇文章主要介绍了Python函数__new__及__init__作用及区别解析,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2020-08-08
python删除特定文件的方法
这篇文章主要介绍了python删除特定文件的方法,涉及Python文件查找及删除的相关技巧,需要的朋友可以参考下
2015-07-07

Pyspark获取并处理RDD数据代码实例

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具