pandas 实现某一列分组,其他列合并成list

 更新时间:2021年03月26日 11:13:48   作者:lxp198837  
这篇文章主要介绍了pandas 实现某一列分组,其他列合并成list的案例。具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧

pandas列转换为字典,但将相同第一列(键)的所有值合并为一个键

形式一:

import pandas as pd 
# data
data = pd.DataFrame({'column1':['key1','key1','key2','key2'],
    'column2':['value1','value2','value3','value3']})
print(data) 
# Grouped dict
data_dict = data.groupby('column1').column2.apply(list).to_dict() 
print(data_dict)

输出结果:

 column1 column2
0  key1 value1
1  key1 value2
2  key2 value3
3  key2 value3 
{'key1': ['value1', 'value2'], 'key2': ['value3', 'value3']}

形式二:

import pandas as pd
# data
df = pd.DataFrame({'column1':['key1','key1','key2','key2'],
    'column2':['value1','value2','value1','value2'],
    'column3':['value11','value11','value22','value22'],
    'column4':['value44','value44','value55','value55']}) 
# Grouped dict
data_dict = df.groupby('column1').apply(lambda x: {col:x[col].tolist() for col in x.columns if col != 'column2'}).to_dict()
print(data_dict) 
data_dict2 = df.groupby('column1').apply(lambda x: {col:x[col].tolist()[0] if col != 'column2' else x[col].tolist() for col in x.columns}).to_dict()
print(data_dict2)

输出结果:

#data_dict
{
  'key1': {
    'column1': ['key1', 'key1'], 
    'column3': ['value11', 'value11'], 
    'column4': ['value44', 'value44']
  }, 
  'key2': {
    'column1': ['key2', 'key2'], 
    'column3': ['value22', 'value22'], 
    'column4': ['value55', 'value55']
  }
}
#data_dict2
{
  'key1': {
    'column1': 'key1', 
    'column2': ['value1', 'value2'], 
    'column3': 'value11', 
    'column4': 'value44'
  }, 
  'key2': {
    'column1': 'key2', 
    'column2': ['value1', 'value2'], 
    'column3': 'value22', 
    'column4': 'value55'
  }
}

补充:pandas中,利用groupby分组后,对字符串字段进行合并拼接

在pandas里对于数值字段而言,groupby后可以用sum()、max()等方法进行简单的处理,对于字符串字段, 如果把它们的值拼接在一起,可以用使用 str.cat() 和 lamda 方法。

如,将下面表格中的内容,对skill字段按照id进行分组合并

实现代码:

import pandas as pd
file_name='test.xlsx'
df=pd.read_excel(file_name)
data=df.groupby('id')['skill'].apply(lambda x:x.str.cat(sep=':')).reset_index()
print(data)

效果如下:

另,数据处理时,常常需要将某一列进行拆分,分列,替换等,相关的函数有str.split()、str.extract()、str.replace().

以上为个人经验,希望能给大家一个参考,也希望大家多多支持脚本之家。如有错误或未考虑完全的地方,望不吝赐教。

相关文章

  • Python搭建代理IP池实现接口设置与整体调度

    Python搭建代理IP池实现接口设置与整体调度

    这篇文章主要介绍了Python搭建代理IP池实现接口设置与整体调度,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
    2019-10-10
  • Python字符串逆序输出的实例讲解

    Python字符串逆序输出的实例讲解

    今天小编就为大家分享一篇关于Python字符串逆序输出的实例讲解,小编觉得内容挺不错的,现在分享给大家,具有很好的参考价值,需要的朋友一起跟随小编来看看吧
    2019-02-02
  • Python实现RLE格式与PNG格式互转

    Python实现RLE格式与PNG格式互转

    在机器视觉领域的深度学习中,很多数据集的标注文件使用RLE的格式。但是神经网络的输入一定是一张图片,为此必须把RLE格式的文件转变为图像格式。本文将利用Python实现RLE格式与PNG格式互转,感兴趣的可以了解一下
    2022-08-08
  • 使用 Visual Studio Code(VSCode)搭建简单的Python+Django开发环境的方法步骤

    使用 Visual Studio Code(VSCode)搭建简单的Python+Djan

    这篇文章主要介绍了使用 Visual Studio Code(VSCode)搭建简单的Python+Django开发环境的方法步骤,小编觉得挺不错的,现在分享给大家,也给大家做个参考。一起跟随小编过来看看吧
    2018-12-12
  • Python接口自动化浅析数据驱动原理

    Python接口自动化浅析数据驱动原理

    这篇文章主要介绍了Python接口自动化浅析数据驱动原理,文中会详细描述怎样使用openpyxl模块操作excel及结合ddt来实现数据驱动,有需要的朋友可以参考下
    2021-08-08
  • 一文详解pygame.sprite的精灵碰撞

    一文详解pygame.sprite的精灵碰撞

    精灵其实在一个游戏程序中,精灵本质指的是一张张小尺寸的图片,比如游戏中的各种道具、人物、场景装饰等,它们都可以看做成一张张小的“精灵”图,下面这篇文章主要给大家介绍了关于pygame.sprite精灵碰撞的相关资料,需要的朋友可以参考下
    2023-01-01
  • python开启多个子进程并行运行的方法

    python开启多个子进程并行运行的方法

    这篇文章主要介绍了python开启多个子进程并行运行的方法,涉及Python进程操作的相关技巧,具有一定参考借鉴价值,需要的朋友可以参考下
    2015-04-04
  • vscode写python时的代码错误提醒和自动格式化的方法

    vscode写python时的代码错误提醒和自动格式化的方法

    这篇文章主要介绍了vscode写python时的代码错误提醒和自动格式化的方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
    2020-05-05
  • Python面向对象程序设计之类和对象、实例变量、类变量用法分析

    Python面向对象程序设计之类和对象、实例变量、类变量用法分析

    这篇文章主要介绍了Python面向对象程序设计之类和对象、实例变量、类变量用法,结合实例形式分析了Python面向对象程序设计中类和对象、实例变量、类变量具体功能、原理、使用方法与操作注意事项,需要的朋友可以参考下
    2020-03-03
  • Pytorch 使用Google Colab训练神经网络深度学习

    Pytorch 使用Google Colab训练神经网络深度学习

    本文以VOC数据集为例,因此在训练的时候没有修改classes_path等,如果是训练自己的数据集,各位一定要注意修改classes_path等其它参数
    2022-04-04

最新评论