• Home
  • /
  • Author: Andito Haryo Saputro

Pengenalan Fungsi Dasar Pandas Library di Python

Pandas library termasuk salah satu library yang paling populer di antara banyak Python library. Pandas library sering digunakan karena kemampuannya untuk mengelola data berbentuk tabel (lebih lanjut disebut dengan dataframe) dimana sebagian besar data science project menggunakan data berbasis tabel. Sebagai Python Data Scientist maupun pemula yang baru mempelajari data science, sangat penting untuk menguasai fungsi-fungsi dasar yang ada dalam Pandas library.

Artikel kali ini akan membahas fungsi-fungsi dasar apa saja sih yang ada di Pandas Library, yang sering digunakan oleh para data scientist.

Tutorial Membuat Kurva ROC (Receiver Operating Characteristic) dengan Python

Dalam membuat model AI (artificial intelligence), salah satu tools yang sering digunakan oleh seorang Python Data Scientist untuk memvisualisasikan performa model yang dibuat adalah dengan membuat kurva ROC (Receiver Operating Characteristic). Kurva ROC adalah kurva yang menyajikan ilustrasi performansi dari binary classifier system dalam menghasilkan sebuah prediksi. Kurva ROC didapatkan dengan membuat plotting dari true positive rate (TPR) terhadap false positive rate (FPR).

Artikel ini nanti akan membahas bagaimana membuat kurva ROC menggunakan Python.

Tutorial K-Means Clustering dengan Python

Di Machine Learning, clustering termasuk di dalam unsupervised-algorithm yang berarti bahwa tidak ada proses training. Tujuan dari clustering adalah untuk memisahkan data ke dalam kelompok-kelompok dengan sifat-sifat yang sama dan menetapkannya ke dalam sebuah kategori.

Ada beberapa algoritma clustering yang bisa digunakan, di antaranya adalah: K-Means clustering, Mean-Shift Clustering, DBSCAN, Expectation–Maximization (EM) Clustering, dan Agglomerative Hierarchical Clustering. Namun di antara algoritma tersebut, K-Means lah yang sering digunakan dan diajarkan karena faktor kemudahan dalam pemahaman dan pengimplementasiannya.

Artikel kali ini akan membahas bagaimana mengimplementasikan algoritma K-Means Clustering dengan Python.

Tutorial Mann Whitney U-Test dengan Python

Melakukan uji statistik adalah salah satu tugas utama seorang data scientist. Salah satu uji statistik yang sering dilakukan adalah U-Test. U-Test banyak digunakan karena seringkali hasil eksperimen tidak memenuhi asumsi distribusi normal, dan U-test valid untuk dilakukan di dalam situasi tersebut. U-test sering dilakukan dengan software SPSS, namun bisa juga dilakukan dengan Python lho.

Dalam tutorial ini akan dijelaskan bagaimana melakukan U-Test, tepatnya Mann Whitney U-Test dengan Python.

Python Data Visualization dengan Matplotlib Bag. 2 (Histogram, Pie Plot)

Artikel ini adalah bagian 2 dari materi Python Data Visualization dengan Matplotlib, yang merupakan kelanjutan dari membuat plot data dengan Python sebelumnya. Pada bagian ini kita akan belajar mengenai Histogram dan Pie Plot.

Melalui artikel ini, kita akan belajar bagaimana memvisualisasikan data dengan beberapa bentuk diagram, antara lain: histogram, dan juga pie plot. Adapun untuk histogram sendiri, ada dua tipe yang nanti akan dibahas yaitu stacked histogram, dan horizontal histogram, .

Python Data Visualization dengan Matplotlib Bag. 1 (Basic Plot, Bar Plot)

Salah satu kemampuan yang harus dimiliki seorang Data Scientist adalah Python Data Visualization. Data Visualization penting untuk kita supaya bisa mendapatkan gambaran mengenai persebaran data serta insight di dataset. Common case nya adalah Data Scientist diharuskan untuk mem-produce data visualization dari csv dataset. Hal itu dapat dilakukan dengan Matplotlib library.

Di tutorial Python Data Visualization part 1 ini, kita akan belajar bagaimana membuat basic plotting dan bar plot menggunakan salah satu library Python yang handal, yaitu Matplotlib.

Tutorial Python SVM Classification dan Menampilkan Prediction Report dengan Confusion Matrix

SVM (Support Vector Machine) merupakan salah satu metode yang sering digunakan dalam Python clasification algorithm. SVM merupakan salah satu metode dalam supervised learning yang biasanya digunakan untuk klasifikasi dan regresi. SVM memiliki konsep yang lebih matang dan lebih jelas secara matematis dibandingkan dengan teknik-teknik klasifikasi lainnya di dalam pemodelan klasifikasi. SVM juga dapat mengatasi masalah klasifikasi dan regresi dengan linear maupun non linear.

Adapun untuk memvisualisasikan performance dari sebuah algoritma, dapat menggunakan tabel confusion matrix, yang sering disebut juga error matrix.

Artikel kali ini akan membahas implementasi SVM di Python dan melihat performancenya menggunakan confusion matrix. Untuk memudahkan pembahasan, nantinya akan diambil sebuah studi kasus.

Generate CSV berdasarkan Kategori di Python dengan Pandas, OS, dan NumPy

Salah satu kasus yang sering dihadapi seorang Data Scientist adalah diberikan dataset yang stukturnya tidak cocok dengan kebutuhan untuk membuat Machine Learning Model. Sehingga perlu adanya penanganan manual yang termasuk dalam tahap pre-processing data.

Pada artikel ini kita akan membahas bagaimana mengenerate file CSV berdasarkan kategori dengan Python menggunakan library Pandas, OS, dan NumPy.