
Indah Cahya Resti
S1 Sistem Komputer
Student ID
09011281823046
Batch
2018
Graduated
January 2023
Research Theme
"Visualisasi PDF Malware Menggunakan Clustering K-Means pada Layanan GARUDA Kemdikbud Dikti sebagai Agregator Nasional"
K-Means clustering adalah suatu metode untuk mengelompokkan data berdasarkan kesamaan fitur dan mendeteksi pola tersembunyi yang ada dalam kumpulan data. Dataset berasal dari GARUDA Repository yang berisi data mentah file PDF. Proses ekstraksi dataset PDF GARUDA menggunakan metode analisis statik. Proses ekstraksi data menghasilkan 21 fitur menggunakan PDFiD. Dataset GARUDA memiliki banyak kelas dan data tidak seimbang, oleh karena itu diperlukan proses SMOTE. K-Means berhasil mengelompokkan 3 clusters dengan silhouette score sebesar 0,71311. Hasil validasi terbaik menggunakan label K-Means dengan bantuan model Logistic Regression pada 5-Fold. Akurasi menggunakan label K-Means sebesar 94,66%, sehingga pelabelan K-Means lebih baik dibandingkan menggunakan label PDF GARUDA yang hanya mendapatkan akurasi sebesar 87,16%.