Analisis Komparatif Metode Pemilihan Fitur untuk Deteksi URL Phishing Berbasis Pembelajaran Mesin

Gambar Ilustrasi AI

FORMOSA NEWS - Cikarang. Metode Seleksi Fitur LASSO Pangkas Waktu Deteksi Website Phishing Hingga 46 Persen Tanpa Mengorbankan Akurasi. Penelitian yang dilakukan oleh Farah Yulianti dan Jessica Forenziana dari Universitas President dalam artikel penelitian yang dipublikasikan pada Formosa Journal of Computer and Information Science (FJCIS) edisi Vol. 5 No. 2 Tahun 2026 menyoroti bahwa metode seleksi fitur berbasis LASSO mampu mengurangi jumlah fitur struktur URL dari 20 menjadi hanya 5 fitur utama tanpa menurunkan tingkat akurasi deteksi.

Konteks dan Urgensi Perlindungan Siber

Serangan phishing terus menjadi salah satu ancaman kejahatan siber paling dominan di tingkat global, yang mengincar informasi sensitif seperti kredensial akun dan data keuangan pengguna. Metode perlindungan tradisional yang mengandalkan daftar hitam domain (blacklist) atau analisis konten halaman web sering kali kewalahan menghadapi kemunculan situs fiktif baru yang menggunakan enkripsi HTTPS atau pemuatan konten secara dinamisPenggunaan algoritma machine learning berbasis teks URL menjadi alternatif efektif karena mampu mengenali pola penipuan secara langsung dari struktur alamat web. Namun, penggunaan variabel data yang terlalu banyak memperlambat waktu komputasi saat dijalankan pada perangkat pengguna, seperti pada ekstensi peramban (browser extension) atau gerbang penapis email (email gateway). Oleh karena itu, efisiensi jumlah fitur data menjadi kunci utama dalam menghadirkan perlindungan siber yang responsif.

Metodologi dan Desain Penelitian
Farah Yulianti dan Jessica Forenziana menguji tiga kategori metode seleksi fitur yaitu filter-based (Chi-square dan Information Gain), wrapper-based (Recursive Feature Elimination), serta embedded-based (LASSO dan Random Forest Importance) pada PhiUSIIL Phishing URL Dataset. Basis data ini mencakup 235.795 sampel alamat web yang terdiri dari 134.850 URL sah dan 100.945 URL phishingUntuk memastikan efisiensi dan realistis saat diterapkan di lapangan, para peneliti secara khusus membatasi analisis hanya pada 20 fitur struktural yang dapat diekstraksi langsung dari teks URL, seperti rasio karakter khusus, penggunaan protokol HTTPS, dan panjang domain. Penelitian ini mengevaluasi kinerja klasifikasi menggunakan tiga algoritma utama Random Forest, Gradient Boosting, dan Logistic Regression melalui skema 5-fold cross-validation.

Temuan Kunci Penelitian
Evaluasi eksperimental menghasilkan beberapa temuan penting terkait performa komputasi dan akurasi:

  • Efisiensi Seleksi Fitur: Metode embedded LASSO pada jumlah fitur terkecil ($k=5$) berhasil mencatatkan nilai performa F1-score sebesar 0,9975. Angka ini setara secara operasional dengan skor model basis 20 fitur (0,9965).
  • Pengurangan Waktu Latensi: Dengan mengeliminasi 75 persen fitur yang tidak krusial, waktu prediksi algoritma Random Forest turun drastis dari 542,1 milidetik menjadi 288.8 milidetik, yang berarti terjadi efisiensi waktu sebesar 46,7 persen.
  • Kelemahan Metode Filter: Metode penapisan berbasis statistik seperti Chi-square menunjukkan penurunan performa paling signifikan pada jumlah 5 fitur (F1-score 0,9879) karena gagal menangkap interaksi non-linear antar variabel data.
  • Variabel Penentu Serangan: Analisis transparansi model menggunakan SHAP (SHapley Additive exPlanations) mengonfirmasi bahwa indikator keberadaan sertifikat HTTPS (IsHTTPS), jumlah karakter khusus (NoOfOtherSpecialCharsInURL), dan rasio huruf (LetterRatioInURL) merupakan penanda paling dominan dalam membedakan situs penipuan dari situs asli.
Implikasi dan Manfaat Praktis
Temuan dari Universitas President ini memberikan kontribusi nyata bagi para pengembang perangkat lunak keamanan siber dan praktisi teknologi informasi. Dengan membuktikan bahwa tingkat ketepatan deteksi di atas 99,7 persen dapat dicapai hanya dengan 5 fitur struktural, sistem keamanan tidak perlu lagi mengunduh atau menganalisis kode sumber halaman web yang memakan banyak waktu dan memori. Pendekatan ini memungkinkan industri siber untuk menciptakan alat pemindai phishing yang jauh lebih ringan, hemat daya, serta dapat menjaga privasi pengguna saat dipasang pada perangkat seluler maupun peramban web.

Profil Penulis
Farah Yulianti, M.Sc. adalah peneliti dan dosen di bidang ilmu komputer dan machine learning di Universitas President, dengan fokus keahlian pada rekayasa fitur, pengenalan pola, dan aplikasi keamanan siber.
Jessica Forenziana, S.Kom. adalah peneliti bidang teknologi informasi di Universitas President yang berfokus pada optimasi algoritma machine learning, efisiensi komputasi, dan sains data.

Sumber Penelitia
Farah Yulianti, Jessica Forenziana. A Comparative Analysis of Feature Selection Methods for Machine Learning-Based Phishing URL Detection. Formosa Journal of Computer and Information Science (FJCIS).Vol. 5, No. 2, hlm. 243-258
DOI : https://doi.org/10.55927/fjcis.v5i2.16783
URL: https://journal.formosapublisher.org/index.php/fjcis

Posting Komentar

0 Komentar