Main Logo
  • Home
  • About
  • Kursus
    • Paket Kursus
    • Roadmap Profesi
    • Data & AI
      • Data Analyst
      • Data Scientist
      • AI Engineer
      • Data Engineer
      • Business Intelligence (BI) Specialist
    • Infrastruktur & Keamanan
      • Network Engineer
      • System Engineer
      • DevOps Engineer
      • Security Engineer
      • Cloud Engineer
    • Programming & Web Development
      • Web & App Developer
      • Web Developer
      • WordPress Developer
      • Mobile Developer
    • Spesialisasi
      • Blockchain Engineer
      • IOT Engineer
      • Digital Marketing Specialist
  • Elearning
  • Blog
  • Portfolio
Daftar
Main Logo
  • Home
  • About
  • Kursus
    • Paket Kursus
    • Roadmap Profesi
    • Data & AI
      • Data Analyst
      • Data Scientist
      • AI Engineer
      • Data Engineer
      • Business Intelligence (BI) Specialist
    • Infrastruktur & Keamanan
      • Network Engineer
      • System Engineer
      • DevOps Engineer
      • Security Engineer
      • Cloud Engineer
    • Programming & Web Development
      • Web & App Developer
      • Web Developer
      • WordPress Developer
      • Mobile Developer
    • Spesialisasi
      • Blockchain Engineer
      • IOT Engineer
      • Digital Marketing Specialist
  • Elearning
  • Blog
  • Portfolio

Mengenal Outlier: Data yang Berbeda dari Pola Umumnya

  • August 21, 2026
  • oleh Avrillia Zahra Khoirun Nisa

Dalam sebuah dataset, sebagian besar data biasanya memiliki pola yang relatif mirip. Namun, terkadang ada satu atau beberapa nilai yang terlihat jauh berbeda dari data lainnya. Misalnya, jika sebagian besar nilai berada di antara 50–80, tetapi terdapat satu nilai 250. Data seperti ini disebut outlier.

Apakah data yang berbeda jauh selalu berarti data tersebut salah? Belum tentu. Justru di sinilah outlier menjadi menarik untuk dipelajari.

Apa itu Outlier?

Outlier adalah data yang memiliki nilai jauh berbeda dari sebagian besar data dalam suatu kumpulan. Sederhananya, outlier merupakan data yang berada di luar pola umum dataset.

Contohnya, terdapat data nilai ujian:

72, 75, 78, 80, 74, 77, 76, 79, 15

Sebagian besar nilai berada di sekitar 70–80, sedangkan nilai 15 terlihat sangat berbeda. Nilai tersebut bisa menjadi outlier.

Namun, kita tidak bisa langsung menyimpulkan bahwa angka 15 merupakan kesalahan. Bisa saja siswa tersebut memang mendapatkan nilai 15. Oleh karena itu, menemukan outlier bukan berarti langsung menghapusnya.

Mengapa Outlier Bisa Muncul?

Outlier dapat muncul karena berbagai alasan. Beberapa di antaranya berasal dari kesalahan saat proses pengumpulan atau input data, tetapi ada juga yang memang menggambarkan kondisi sebenarnya.

Contohnya:

  • Kesalahan memasukkan angka
  • Kesalahan satuan
  • Data hasil pengukuran yang tidak normal
  • Kesalahan sistem atau sensor
  • Kejadian yang memang jarang terjadi
  • Perbedaan karakteristik objek dengan data lainnya

Misalnya sebuah dataset berisi tinggi badan siswa dalam satuan sentimeter. Sebagian besar data berada di sekitar 150–180 cm, tetapi terdapat nilai 1750 cm.

Nilai tersebut kemungkinan besar bukan kondisi sebenarnya, melainkan kesalahan input atau satuan.

Berbeda jika sebuah dataset penjualan memiliki satu hari dengan jumlah transaksi yang jauh lebih tinggi dibandingkan hari lainnya. Data tersebut mungkin memang benar karena sedang terjadi promosi besar.

Apakah Outlier Selalu Merupakan Kesalahan?

Tidak.

Ini merupakan salah satu hal penting dalam data cleaning. Outlier memang terlihat berbeda, tetapi perbedaan tersebut tidak otomatis membuat datanya salah.

Bayangkan sebuah toko memiliki data penjualan selama 30 hari. Hampir setiap hari terdapat sekitar 50–100 transaksi, tetapi pada satu hari terdapat 500 transaksi.

Angka 500 dapat dianggap sebagai outlier karena jauh dari pola data lainnya. Namun, sebelum menghapusnya, kita perlu mencari tahu penyebabnya.

Mungkin pada hari tersebut toko sedang mengadakan promo. Jika memang benar, maka data 500 transaksi justru merupakan informasi penting dan sebaiknya tetap dipertahankan.

Jadi, outlier harus diperiksa terlebih dahulu sebelum diputuskan untuk dihapus atau dipertahankan.

Bagaimana Cara Menemukan Outlier?

Ada beberapa metode yang dapat digunakan untuk menemukan outlier. Dua metode yang cukup umum digunakan adalah IQR (Interquartile Range) dan Z-score.

1. Menggunakan IQR

IQR merupakan jarak antara kuartil pertama (Q1) dan kuartil ketiga (Q3).

Rumusnya:

IQR = Q3 - Q1

Kemudian batas bawah dan batas atas dapat dihitung menggunakan:

Batas bawah = Q1 - 1.5 × IQR
Batas atas  = Q3 + 1.5 × IQR

Data yang berada di luar batas tersebut dapat dianggap sebagai kandidat outlier.

Metode IQR cukup sering digunakan karena relatif sederhana dan tidak terlalu bergantung pada distribusi normal data.

Kita akan mempraktikan menggunakan metode IQR di pandas dengan data nilai di bawah ini.

import pandas as pd

data = {
    "Nilai": [72, 75, 78, 80, 74, 77, 76, 79, 81, 73,
              82, 78, 75, 80, 77, 74, 83, 76, 79, 15]
}

df = pd.DataFrame(data)

Q1 = df["Nilai"].quantile(0.25)
Q3 = df["Nilai"].quantile(0.75)

IQR = Q3 - Q1

batas_bawah = Q1 - 1.5 * IQR
batas_atas = Q3 + 1.5 * IQR

print("Q1:", Q1)
print("Q3:", Q3)
print("IQR:", IQR)
print("Batas bawah:", batas_bawah)
print("Batas atas:", batas_atas)

outlier = df[
    (df["Nilai"] < batas_bawah) |
    (df["Nilai"] > batas_atas)
]

print("\nData yang terdeteksi sebagai outlier:")
print(outlier)

2. Menggunakan Z-Score

Z-score menunjukkan seberapa jauh suatu nilai dari rata-rata dalam satuan standar deviasi.

Secara sederhana:

Z = (x - μ) / σ

Keterangan:

  • x = nilai data
  • μ = rata-rata
  • σ = standar deviasi

Semakin jauh nilai Z dari 0, semakin jauh posisi data tersebut dari rata-rata.

Dalam beberapa kasus, nilai dengan nilai absolut Z-score yang cukup tinggi dapat ditandai sebagai kandidat outlier. Namun, batas yang digunakan tetap perlu disesuaikan dengan karakteristik dataset.

Kita juga akan mempraktikan metode Z-Score dengan kode di bawah ini.

import pandas as pd

# Membuat dataset
data = {
    "ID": range(1, 21),
    "Nilai": [
        72, 75, 78, 80, 74,
        77, 76, 79, 81, 73,
        82, 78, 75, 80, 77,
        74, 83, 76, 79, 15
    ]
}

df = pd.DataFrame(data)

# Menghitung rata-rata
mean = df["Nilai"].mean()

# Menghitung standar deviasi
std = df["Nilai"].std()

# Menghitung Z-score
df["Z_Score"] = (df["Nilai"] - mean) / std

# Menampilkan seluruh data
print("Data dengan Z-score:")
print(df.to_string(index=False))

# Menentukan outlier
# Data dengan |Z-score| > 3 dianggap sebagai kandidat outlier
outlier = df[df["Z_Score"].abs() > 3]

print("\nData yang terdeteksi sebagai outlier:")
print(outlier.to_string(index=False))

Melihat Outlier dengan Boxplot

Selain menggunakan perhitungan, outlier juga dapat lebih mudah dipahami secara visual menggunakan boxplot.

Boxplot menampilkan distribusi data melalui beberapa bagian seperti median, kuartil, serta rentang data. Titik yang berada jauh di luar pola utama dapat terlihat sebagai titik terpisah.

Mau Kuasai Mengenal Outlier: Data yang Berbeda dari Pola Umumnya Sampai Bisa Praktik Langsung?

Materi ini juga kami ajarkan langsung di kelas Edusoft Center, dibimbing mentor, sampai kamu bisa praktik nyata — bukan cuma baca teori.

Tanya Kursus via WhatsApp Lihat contoh project nyata dari siswa kami →

Contoh sederhana:

72   74   75   76   77   78   79   80   81   82   83                 15
|===============================|-------------------------------------|
            data utama                                      outlier

Dalam praktik analisis data, visualisasi seperti boxplot membantu kita melihat apakah sebuah nilai memang terlihat berbeda dari sebagian besar data.

Untuk melihat outlier secara sederhana, kita bisa menggunakan Python dengan library pandas dan matplotlib.

Contoh dataset:

import pandas as pd
import matplotlib.pyplot as plt

# Membuat dataset
data = {
    "ID": range(1, 21),
    "Nilai": [
        72, 75, 78, 80, 74,
        77, 76, 79, 81, 73,
        82, 78, 75, 80, 77,
        74, 83, 76, 79, 15
    ]
}

df = pd.DataFrame(data)

# Membuat boxplot
plt.figure(figsize=(8, 5))
plt.boxplot(df["Nilai"])
plt.title("Boxplot Nilai Ujian")
plt.ylabel("Nilai")
plt.xticks([1], ["Nilai Ujian"])
plt.show()

Ketika kode tersebut dijalankan, akan muncul boxplot dari data nilai yang digunakan.

Nilai yang jauh dari kumpulan data utama dapat terlihat sebagai titik yang berada di luar area boxplot.

Dengan praktik sederhana ini, kita dapat melihat bahwa proses menemukan outlier tidak selalu harus dilakukan dengan melihat tabel data satu per satu. Visualisasi dapat membantu memberikan gambaran yang lebih mudah dipahami.

Bagaimana Cara Menangani Outlier?

Setelah menemukan outlier, langkah berikutnya bukan langsung menekan tombol delete. Kita perlu menentukan terlebih dahulu apakah data tersebut merupakan kesalahan atau memang menggambarkan kondisi yang sebenarnya.

Beberapa pendekatan yang dapat digunakan antara lain:

Menghapus Outlier

Jika setelah diperiksa ternyata outlier berasal dari kesalahan input, data tersebut dapat diperbaiki atau dihapus.

Misalnya:

Tinggi badan:

  • 160
  • 165
  • 172
  • 168
  • 1750

Jika 1750 ternyata merupakan kesalahan input, data tersebut dapat diperbaiki berdasarkan sumber data yang benar.

Mempertahankan Outlier

Jika data tersebut valid dan memang menggambarkan kejadian nyata, outlier sebaiknya tetap dipertahankan.

Contohnya adalah data penjualan yang meningkat drastis karena adanya promosi. Nilai tersebut memang berbeda dari pola normal, tetapi tetap merupakan informasi yang valid.

Melakukan Transformasi Data

Dalam beberapa kasus, outlier dapat ditangani dengan transformasi tertentu agar distribusi data menjadi lebih sesuai untuk analisis atau pemodelan.

Namun, metode ini perlu disesuaikan dengan jenis data dan tujuan analisis. Tidak semua outlier harus ditransformasi.

Outlier dalam Dunia Nyata

Outlier tidak hanya ditemukan dalam dataset latihan. Dalam dunia nyata, data ekstrem dapat muncul dalam berbagai situasi.

Misalnya:

  • Data transaksi dengan pembelian dalam jumlah sangat besar
  • Data sensor yang tiba-tiba menunjukkan nilai ekstrem
  • Data penggunaan server yang meningkat drastis
  • Data waktu akses aplikasi yang jauh lebih lama
  • Data penjualan yang melonjak pada periode tertentu

Menariknya, outlier dalam kasus seperti ini justru bisa menjadi sesuatu yang ingin kita cari.

Contohnya pada monitoring server, lonjakan penggunaan CPU yang jauh lebih tinggi dari kondisi normal dapat menjadi tanda bahwa ada aktivitas tertentu yang sedang terjadi. Artinya, data yang awalnya terlihat sebagai “data aneh” justru dapat memberikan informasi penting.

Jadi, Haruskah Semua Outlier Dihapus?

Jawabannya adalah tidak.

Outlier sebaiknya diperlakukan sebagai sesuatu yang perlu diperiksa. Kita perlu mencari tahu penyebabnya, melihat sumber datanya, dan mempertimbangkan tujuan analisis sebelum menentukan tindakan.

Jika outlier berasal dari kesalahan input, memperbaiki data mungkin menjadi pilihan yang tepat. Jika outlier merupakan kejadian nyata, menghapusnya justru dapat menghilangkan informasi penting dari dataset.

Karena itu, proses data cleaning membutuhkan lebih dari sekadar aturan otomatis. Kita juga perlu memahami konteks dari data yang sedang dianalisis.

Kesimpulan

Outlier adalah data yang memiliki nilai berbeda jauh dari pola umum dalam suatu dataset. Data seperti ini dapat muncul karena berbagai alasan, mulai dari kesalahan input hingga kejadian nyata yang memang jarang terjadi.

Untuk menemukan outlier, kita dapat menggunakan beberapa metode seperti IQR, Z-score, dan boxplot. Namun, menemukan outlier hanyalah langkah awal. Hal yang lebih penting adalah memahami mengapa data tersebut berbeda dan menentukan apakah data perlu diperbaiki, dipertahankan, atau ditangani dengan metode tertentu.

Pada akhirnya, data yang berbeda bukan berarti data yang salah. Dalam beberapa kasus, justru data yang terlihat paling berbeda dapat memberikan informasi yang paling menarik. Inilah alasan mengapa outlier menjadi salah satu hal penting yang perlu diperhatikan dalam proses Data Cleaning.

Dibuat oleh:

Avrillia Zahra Khoirun Nisa

Mau Kuasai Mengenal Outlier: Data yang Berbeda dari Pola Umumnya Sampai Bisa Praktik Langsung?

Materi ini juga kami ajarkan langsung di kelas Edusoft Center, dibimbing mentor, sampai kamu bisa praktik nyata — bukan cuma baca teori.

Tanya Kursus via WhatsApp Lihat contoh project nyata dari siswa kami →

Tags: Anomaly DetectionBoxplotData Analyticsdata cleaningData ExplorationData ScienceData VisualizationIQRMetplotibOutlierpandaspythonStatisticsZ-Score
Previous Post
Next Post

Post comment

Cancel reply

Your email address will not be published. Required fields are marked *

Recent Posts

  • CASE WHEN Bertingkat di SQL: Segmentasi Customer Berdasarkan Total Transaksi (VIP, Reguler, Baru)
  • Mengenal Outlier: Data yang Berbeda dari Pola Umumnya
  • Cara Membersihkan Data Log Jaringan Menggunakan Python
  • Business Question: Cara Menyusun Pertanyaan Data yang Tajam
  • Cara Menjawab Business Question dengan Kombinasi SQL dan Python

Arsip

  • August 2026
  • July 2026
  • June 2026
  • April 2026
  • March 2026
  • February 2026
  • January 2026
  • September 2025
  • August 2025
  • July 2025
  • March 2019
  • February 2019
  • January 2019
  • December 2018
  • November 2018
  • October 2018
  • September 2018
  • August 2018
  • July 2018
  • June 2018
  • May 2018
  • April 2018
  • March 2018
  • February 2018
  • January 2018
  • December 2017
  • November 2017
  • October 2017
  • September 2017
  • August 2017
  • July 2017
  • June 2017
  • May 2017
  • April 2017
  • March 2017
  • February 2017
  • January 2017
  • December 2016
  • November 2016
  • October 2016
  • September 2016
  • August 2016
  • July 2016
  • June 2016
  • May 2016
  • April 2016
  • March 2016
  • February 2016
  • January 2016
  • December 2015
  • November 2015
  • October 2015
  • September 2015
  • August 2015
  • July 2015
  • June 2015
  • May 2015
  • April 2015
  • March 2015
  • February 2015
  • January 2015
  • December 2014
  • November 2014
  • October 2014
  • September 2014
  • August 2014
  • July 2014
  • June 2014
  • May 2014
  • April 2014
  • March 2014
  • February 2014
  • January 2014
  • December 2013
  • November 2013
  • October 2013
  • September 2013
  • August 2013
  • July 2013
  • June 2013
  • May 2013
  • April 2013
  • March 2013
  • February 2013
  • January 2013
  • December 2012
  • November 2012
  • October 2012
  • September 2012
  • August 2012
  • July 2012
  • June 2012
  • May 2012
  • April 2012
  • December 2011
  • November 2011

Tags

apache web server dns server kursus android kursus database kursus dns dan web server kursus dns server kursus ethical hacking kursus hacking kursus jaringan kursus jaringan linux Kursus Komputer kursus komputer di solo kursus komputer di solo / surakarta kursus komputer di surakarta kursus linux Kursus Linux Forensics kursus linux networking kursus linux security kursus linux server kursus mikrotik kursus networking kursus network security kursus php Kursus PHP dan MySQL kursus php mysql kursus proxy kursus security kursus ubuntu kursus ubuntu server kursus web kursus web security kursus web server kursus wordpress kursus wordpress theme linux MySQL pelatihan komputer di solo PHP python security training komputer training komputer di solo tutorial php ubuntu wordpress

© Edusoft Center - Kursus Komputer di Solo | 2010 - 2026 | Privacy Policy | Site Map | Portfolio Magang | Butuh tim kami langsung yang mengerjakan? Lihat layanan implementasi →

All Right Reserved

WhatsApp us