Credit Risk Prediction Model

Final Project: Data Science Portfolio

Disusun oleh: Heri Wibowo[cite: 3]

Latar Belakang & Objektif

Industri keuangan memerlukan sistem otomatisasi untuk memitigasi risiko gagal bayar kredit (*bad loan*).

Objektif Proyek

  • Membangun model *machine learning* untuk memprediksi risiko kredit[cite: 3].
  • Membandingkan performa algoritma Logistic Regression dan Random Forest[cite: 3].
  • Mengklasifikasikan status nasabah secara akurat untuk mendukung keputusan bisnis[cite: 3].

Eksplorasi & Pemrosesan Data

Menggunakan Google Colab untuk manajemen data skala besar (`loan_data_2007_2014.csv`)[cite: 3].

Struktur Dataset

  • Total Baris: 466.285[cite: 3]
  • Total Kolom Awal: 75 kolom[cite: 3]
  • Integrasi langsung melalui *Mount* Google Drive[cite: 3].

Formulasi Variabel Target (`loan_status`)

Kelas Kategori Status Pinjaman
0 Good Loan (Lancar)[cite: 3] Fully Paid, Current[cite: 3]
1 Bad Loan (Berisiko)[cite: 3] Charged Off, Default, Late[cite: 3]

Distribusi Data & Tantangan

Proporsi Target Variable:

  • Good Loan (0): 89.07%[cite: 3]
  • Bad Loan (1): 10.93%[cite: 3]
Catatan Solusi: Mengatasi masalah *imbalanced data* menggunakan parameter class_weight='balanced' guna mendongkrak *recall* pada kelas berisiko.

Pemodelan & Evaluasi

Algoritma yang diuji:

  • Logistic Regression[cite: 3]
  • Random Forest[cite: 3]

Kesimpulan Proyek

  • Pipeline *data science* berhasil dieksekusi dari hulu ke hilir secara terstruktur.
  • Model mampu meminimalkan risiko lolosnya nasabah gagal bayar (*default*).
  • Dokumentasi lengkap tersedia di repositori GitHub[cite: 3].

Terima Kasih

Sesi Tanya Jawab

Domain: datascientist.it.heriwibowo.id