pandas中的drop_duplicates和duplicated的应用

wxc20062006

1395人浏览 · 2019-12-17 11:02:22

wxc20062006 · 2019-12-17 11:02:22 发布

在pandas中，duplicated和drop_duplicates函数用来对DateFrame来进行去重。

默认情况下，drop_duplicates只保留第一次出现的组合，如果需要保留最后一次出现的组合，需要使用keep='last'参数。

#!/usr/bin/python
# -*- coding: UTF-8 -*-

import pandas as pd
from pandas import Series, DataFrame
from numpy import nan as NA
import numpy as np

data2 = DataFrame({'k1': ['one', 'two'] * 3 + ['two'], 'k2': [1, 1, 2, 3, 3, 4, 4]})
print (data2)
#duplicated, 返回布尔型，表示是否重复, 在使用duplicated和drop_duplicates去重时
print (data2.duplicated())
print (data2.drop_duplicates())
data2['v'] = range(7)
print (data2)
#保留第一个重复出现的组合
print (data2.drop_duplicates(['k1']))
#保留最后一个出现的组合
print (data2.drop_duplicates(['k1','k2'], keep='last'))

CSDN学习社区

CSDN联合极客时间，共同打造面向开发者的精品内容学习社区，助力成长！

更多推荐

cover

Kaldi之父，IEEE Fellow，小米首席语音科学家Daniel Povey将出席2024全球机器学习技术大会并发表演讲！

CSDN学习社区

cover

探索神经网络在商品销售和图像识别中的应用

CSDN学习社区

cover

基于stm32F103的座面声控台灯

CSDN学习社区

所有评论(0)

查看更多评论

wxc20062006

已为社区贡献1条内容