pandas删除重复数据简单方法

2023-07-07 12:00:20 作者：**星光*

这篇文章主要给大家介绍了关于pandas删除重复数据的简单方法,在数据处理过程中常常会遇到重复的问题,文中通过实例代码介绍的非常详细,需要的朋友可以参考下

1、pandas中重复索引问题

df = df[~df.index.duplicated()]

2、pandas删除重复数据行

# 首先导入常用的两个包 import pandas as pd import numpy as np # 1.删除完全重复的行 df.drop_duplicates() 2.按k列进行去重，对于重复项，保留第一次出现的值 df.drop_duplicates('k',keep='first') 3、k2和k1两列进行去重 df.drop_duplicates(['k2','k1'], keep='first') keep：{‘first', ‘last', False}, 默认值 ‘first' first：保留第一次出现的重复行，删除后面的重复行。 last：删除前面的重复项，保留最后一次出现的重复行。 False：删除所有重复项

3、drop_duplicates()函数的语法

df.drop_duplicates(subset=['A','B','C'],keep='first',inplace=True)

参数说明如下：

subset：表示要进去重的列名，默认为 None。
keep：有三个可选参数，分别是 first、last、False，默认为 first，表示只保留第一次出现的重复项，删除其余重复项，last 表示只保留最后一次出现的重复项，False 则表示删除所有重复项。
inplace：布尔值参数，默认为 False 表示删除重复项后返回一个副本，若为 Ture 则表示直接在原数据上删除重复项。

附：pandas数据处理——取出重复数据

平常我们用pandas做重复数据处理时，常常调用到drop_duplicates方法来去除重。

现在我不想完全去除重复，而是把重复数据输出，现有数据如下所示：

重复数据保留一个，duplicate_bool输出的是bool类型值，通过判断bool==True，取出重复行。

duplicate_bool = df.duplicated(subset=['id'], keep='first')
repeat=df.loc[duplicate_bool == True]
repeat复制

到此这篇关于pandas删除重复数据的文章就介绍到这了,更多相关pandas删除重复数据内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

Python pandas找出、删除重复的数据实例

python Xarray处理设置二维数组作为coordinates方式 — python Xarray处理设置二维数组作为coordinate

工信部称网盘企业免费用户最低速率应满足基本下载需求，天翼云盘回应：坚决支持，始终

电脑版 - 返回首页

2006-2023 脚本之家 JB51.Net , All Rights Reserved.
苏ICP备14036222号

推荐文章

光明磊落的茶壶 · Pandas数据分析从入门到实�%8-_Bilibili

2 周前

礼貌的萝卜 · 数据分析活用Pandas库/-_Bilibili

2 周前

绅士的创口贴 · 震惊! 居然可以用python在短短几秒内处理几十亿数据！_vaex

1 周前

被表白的橙子 · 使用Python Pandas处理亿级数据开发者社区

1 周前

独立的帽子 · python ssl错误proxy错误解决思路 - 简书

1 年前

英俊的乌龙茶 · 无法将jps，jstat，jinfo，jstack等项识别为 cmdlet、函数、脚本文件或可运行程序的名称的解决办法_无法将“c:\windows\system32”项识别为 cmdlet、函数、脚

1 年前

彷徨的充电器 · 使用java8API遍历过滤文件目录及子目录及隐藏文件-腾讯云开发者社区-腾讯云

2 年前

温文尔雅的豆腐 · javascript - How to push ajax serializeObject function - Stack Overflow

2 年前

重感情的机器人 · unity building gradle project卡住-掘金

2 年前