Main Logo
  • Home
  • About
  • Kursus
    • Paket Kursus
    • Roadmap Profesi
  • Elearning
  • Blog
Daftar
Main Logo
  • Home
  • About
  • Kursus
    • Paket Kursus
    • Roadmap Profesi
  • Elearning
  • Blog

Cara Hapus Data Duplikat di Pandas

  • July 20, 2026
  • oleh Edusoft Center

Saat kita mengolah data, ada satu masalah klasik yang hampir selalu muncul: data duplikat. Baris data yang muncul lebih dari sekali bisa bikin hasil analisis kita tidak akurat, misalnya menghitung total penjualan atau jumlah pengguna secara ganda.

Di tutorial kali ini, kita akan bedah cara mendeteksi dan menghapus data duplikat menggunakan Pandas di Python sampai tuntas.


Prasyarat & Persiapan File

Sebelum memulai, pastikan kamu sudah memasang Python dan library Pandas. Jika belum, kamu bisa mengisntalnya via terminal/CMD dengan perintah:

pip install pandas

Untuk mengikuti tutorial ini, kamu punya dua opsi cara membuat filenya:

  • Opsi A (File Python `.py`): Buat file baru bernama main.py atau tutorial_duplikat.py di text editor favoritmu (seperti VS Code), lalu jalankan filenya lewat terminal.
  • Opsi B (Jupyter Notebook / Google Colab – Direkomendasikan): Buat notebook baru bernama hapus_duplikat.ipynb. Opsi ini paling nyaman karena kamu bisa melihat tabel data secara langsung per langkah.

1. Persiapan: Menyiapkan Data Latihan

Supaya paham konsepnya, yuk buat DataFrame sederhana yang sengaja memiliki beberapa baris data ganda.

import pandas as pd

# Membuat data tiruan
data = {
    'ID': [101, 102, 101, 103, 102],
    'Nama': ['Andi', 'Budi', 'Andi', 'Cici', 'Budi'],
    'Kota': ['Jakarta', 'Bandung', 'Jakarta', 'Surabaya', 'Bandung']
}

# Mengubah dictionary menjadi DataFrame
df = pd.DataFrame(data)

print("Data Awal:")
print(df)
Output
    ID  Nama      Kota
0  101  Andi   Jakarta
1  102  Budi   Bandung
2  101  Andi   Jakarta
3  103  Cici  Surabaya
4  102  Budi   Bandung

Perhatikan: Baris indeks ke-2 sama persis dengan ke-0, dan baris ke-4 sama persis dengan ke-1.

2. Mendeteksi Data Duplikat (.duplicated())

Sebelum menghapus, ada baiknya kita cek dulu baris mana saja yang dianggap ganda oleh Pandas. Kita bisa pakai fungsi duplicated().

# Cek baris duplikat
print(df.duplicated())
Output
0    False
1    False
2     True
3    False
4     True
dtype: bool

Penjelasan:

  • False artinya baris tersebut baru pertama kali muncul.
  • True artinya baris tersebut adalah duplikat dari baris yang sudah ada sebelumnya (indeks 2 dan 4).

Kalau ingin menampilkan baris data yang duplikat saja dalam bentuk tabel, Anda bisa gunakan teknik boolean indexing:

# Menampilkan hanya baris duplikat
print(df[df.duplicated()])

3. Menghapus Data Duplikat (.drop_duplicates())

Nah, ini bagian utamanya. Untuk menghapus baris yang ganda, gunakan fungsi drop_duplicates().

# Hapus baris duplikat
df_bersih = df.drop_duplicates()

print("Data Setelah Duplikat Dihapus:")
print(df_bersih)
Output
    ID  Nama      Kota
0  101  Andi   Jakarta
1  102  Budi   Bandung
3  103  Cici  Surabaya

Baris indeks 2 dan 4 berhasil dihilangkan!

4. Opsi Lanjutan yang Sering Dipakai

Fungsi drop_duplicates() punya beberapa parameter berguna yang bikin proses pembersihan data jadi lebih fleksibel:

A. Memilih Data Mana yang Dipertahankan (keep)

Secara default, Pandas menyimpan baris pertama (keep='first'). Tapi kita bisa ubah parameternya:

  • Menyimpan baris terakhir yang muncul:
    df.drop_duplicates(keep='last')
  • Menghapus semua baris yang terlibat duplikat (tidak menyisakan satu pun):
    df.drop_duplicates(keep=False)

B. Menghapus Duplikat Berdasarkan Kolom Tertentu (subset)

Terkadang, kita hanya ingin menganggap data itu duplikat berdasarkan satu atau dua kolom saja, bukan seluruh kolom.

Contoh: Kita mau hapus data kalau Nama-nya sama, tanpa peduli kolom lainnya.

# Cek duplikat hanya di kolom 'Nama'
df_unik_nama = df.drop_duplicates(subset=['Nama'])
print(df_unik_nama)

C. Mengubah Data Langsung Tanpa Bikin Variabel Baru (inplace=True)

Jika Anda ingin langsung menerapkan perubahan ke DataFrame asal tanpa menyimpan ke variabel baru:

df.drop_duplicates(inplace=True)

Rangkuman Kode Lengkap

Berikut ringkasan skrip lengkap yang bisa langsung Anda copy-paste dan jalankan di Jupyter Notebook atau Google Colab:

import pandas as pd

# 1. Buat Data
df = pd.DataFrame({
    'ID': [101, 102, 101, 103, 102],
    'Nama': ['Andi', 'Budi', 'Andi', 'Cici', 'Budi'],
    'Kota': ['Jakarta', 'Bandung', 'Jakarta', 'Surabaya', 'Bandung']
})

# 2. Cek baris duplikat
print("--- Baris Duplikat ---")
print(df[df.duplicated()])

# 3. Hapus duplikat dan timpa data lama
df.drop_duplicates(inplace=True)

# 4. Tampilkan hasil akhir
print("\n--- Data Bersih ---")
print(df)

Kesimpulan: Dengan memahami fungsi drop_duplicates(), proses data cleaning Anda jadi jauh lebih cepat dan terhindar dari bias data.

Tags: Data Duplikatjupyter notebookpandaspython
Previous Post
Next Post

Post comment

Cancel reply

Your email address will not be published. Required fields are marked *

Recent Posts

  • Panduan Menggunakan Virtual Environment (venv) di Python agar Proyek Data Tetap Rapi
  • Cara Hapus Data Duplikat di Pandas
  • Cara Mendeteksi Missing Values di Dataset
  • Pengenalan SQL dan Query Dasar (SELECT, WHERE, dan ORDER BY)
  • Cara Membaca File CSV dengan Pandas: Dari yang Paling Dasar sampai yang Sering Dipakai

Arsip

  • July 2026
  • June 2026
  • April 2026
  • March 2026
  • February 2026
  • January 2026
  • September 2025
  • August 2025
  • July 2025
  • March 2019
  • February 2019
  • January 2019
  • December 2018
  • November 2018
  • October 2018
  • September 2018
  • August 2018
  • July 2018
  • June 2018
  • May 2018
  • April 2018
  • March 2018
  • February 2018
  • January 2018
  • December 2017
  • November 2017
  • October 2017
  • September 2017
  • August 2017
  • July 2017
  • June 2017
  • May 2017
  • April 2017
  • March 2017
  • February 2017
  • January 2017
  • December 2016
  • November 2016
  • October 2016
  • September 2016
  • August 2016
  • July 2016
  • June 2016
  • May 2016
  • April 2016
  • March 2016
  • February 2016
  • January 2016
  • December 2015
  • November 2015
  • October 2015
  • September 2015
  • August 2015
  • July 2015
  • June 2015
  • May 2015
  • April 2015
  • March 2015
  • February 2015
  • January 2015
  • December 2014
  • November 2014
  • October 2014
  • September 2014
  • August 2014
  • July 2014
  • June 2014
  • May 2014
  • April 2014
  • March 2014
  • February 2014
  • January 2014
  • December 2013
  • November 2013
  • October 2013
  • September 2013
  • August 2013
  • July 2013
  • June 2013
  • May 2013
  • April 2013
  • March 2013
  • February 2013
  • January 2013
  • December 2012
  • November 2012
  • October 2012
  • September 2012
  • August 2012
  • July 2012
  • June 2012
  • May 2012
  • April 2012
  • December 2011
  • November 2011

Tags

#EdusoftCenter apache web server dns server kursus android kursus database kursus dns dan web server kursus dns server kursus ethical hacking kursus hacking kursus jaringan kursus jaringan linux Kursus Komputer kursus komputer di solo kursus komputer di solo / surakarta kursus komputer di surakarta kursus linux Kursus Linux Forensics kursus linux networking kursus linux security kursus linux server kursus mikrotik kursus networking kursus network security kursus php Kursus PHP dan MySQL kursus php mysql kursus proxy kursus security kursus ubuntu kursus ubuntu server kursus web kursus web security kursus web server kursus wordpress kursus wordpress theme linux MySQL pelatihan komputer di solo PHP security training komputer training komputer di solo tutorial php ubuntu wordpress

© Edusoft Center - Kursus Komputer di Solo | 2010 - 2025 | Privacy Policy | Site Map

All Right Reserved

WhatsApp us