Makine öğrenmesi yöntemleriyle doğruluğu yüksek SMS spam tespiti


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Sivas Cumhuriyet Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2025

Tezin Dili: Türkçe

Öğrenci: TUĞÇE ŞENOL

Danışman: Hidayet Takcı

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Günümüzde mobil cihazların yaygınlaşması kısa mesaj servisi kullanımını da artırmıştır. İletişimin yaygın kanallarından biri haline gelen SMS servisi kötü niyetli kullanıcıların da dikkatini çekmeye başlamıştır. Mobil cihazlara normal mesajlar geldiği kadar reklam amaçlı ya da saldırı amaçlı mesajlar da gelmektedir. Reklam veya saldırı amaçlı olarak gönderilen mesajlara istenmeyen (spam) mesaj adı verilir. SMS spam mesajları ile mücadelede akla gelen ilk yöntem spam filtreleme olup bu konuda mobil cihaz üreticileri ve akademisyenler çalışmalar yapmaktadır. Bugüne kadar mesaj filtreleme için anahtar kelimeye, kurala, içeriğe veya makine öğrenmesine dayalı yöntemler çalışılmış olmasına rağmen artan saldırı türleri ve mesaj yoğunlukları nedeniyle hala etkili çözümlere ihtiyaç bulunmaktadır. Bu çalışma, SMS spam tespitini makine öğrenmesi yöntemleriyle gerçekleştirmeyi amaçlamaktadır. Tez temel olarak iki alt bölüm şeklinde organize edilmiştir. Bunlardan ilki veri ön işleme ikincisi ise model oluşturma ve iyileştirmedir. Veri ön işleme kapsamında veri temizleme, özellik çıkarımı ve özellik seçimi gibi çalışmalar yapılmıştır. Veri ön işleme çalışmalarının amacı kaliteli veri elde ederek daha yüksek sınıflandırma doğrulukları elde etmektir. Veri ön işlemenin alt görevlerinden birisi veri temizleme ve temel ön işlemedir. Bu aşamada veri kümesinde yer alan fakat analiz değeri olmayan verilerin silinmesi türünde işler yapılır. Veri ön işleme bölümünün alt görevlerinden bir diğeri özellik çıkarımıdır. Metinsel veriler söz konusu olduğunda özellik çıkarımının amacı metinsel verilerden sayısal özetler elde etmektir. Bu çalışma vektörleştirme olarak da bilinir. Vektörleştirme sayesinde metinsel verilere makine öğrenmesi algoritmaları uygulanabilir hale gelmektedir. Özellik çıkarımı için çalışmamızda Bag-of-Words, TF-IDF ve Word2Vec yöntemlerinin üçü de kullanılmıştır. Metinsel özellikler yüksek boyutlu olduğu için veri ön işleme kapsamında özellik seçimi de çalışmamız kapsamında yapılmıştır. Özellik seçimi yapılmasının iki amacı vardır: (1) sınıflandırma süresini kısaltmak (2) sınıflandırma performansını artırmak. Özellik seçimi için χ² testi, karşılıklı bilgi, LASSO, rasgele orman önemi ve özyinelemeli özellik eleme kullanılmıştır. Veri ön işleme ile ilgili olarak yapılan son işlem özellik ölçeklemedir. Özelliklerin ölçeklenmesi onların standardize edilmesi ya da normalize edilmesi için ihtiyaç duyulan bir çalışmadır. Çalışmamıza etkisi ölçülmek için özellik ölçekleme yöntemleri de kullanılmıştır. Özellik ölçekleme için standart scaler, min-max scaler, robust scaler, binarizer, normalizer, güç dönüştürücü, quantil dönüştürücü ve max absolute scaler yöntemleri kullanılmıştır. Tezin ikinci bölümünde model geliştirme ve model iyileştirmeye dair işler yapılmıştır. Öncelikle SMS spam mesajlarını daha etkili şekilde sınıflandıracak makine öğrenmesi modelleri inşa edilmiştir. Model inşası amacıyla Lojistik Regresyon, Karar Ağaçları, K-en yakın komşu, Destek Vektör Makineleri ve Nearest Centroid algoritmaları kullanılmıştır. Model inşası ve model değerlendirmesi ardından model doğruluklarını artırmak için model iyileştirme adımına geçilmiştir. Model iyileştirme maksadıyla hiperparametre optimizasyonu yapılmıştır. Başlangıç parametreleri ile başlayan çalışma optimize edilmiş parametrelerin elde edilmesi ile sürmüştür. Bunun için GridSearchCV yönteminden yararlanılmıştır. Model iyileştirme için yapılan bir diğer çalışma topluluk öğrenme modellerinin kullanılmasıdır. Topluluk öğrenme kapsamında Bagging ve Boosting kategorilerinden GradientBoosting, XGBoost ve Random Forest algoritmaları kullanılmıştır. Deneysel çalışmalar kapsamında model değerlendirme karışıklık matrisine dayalı olarak doğruluk, hassasiyet, kesinlik, f1-skoru ve ROC-AUC metrikleri kullanılmıştır. Ayrıca model değerlendirme sırasında 10-fold çapraz doğrulamadan yararlanılmıştır. Tez çalışması boyunca veri ve yönteme dair çok sayıda deneme yapılmış ve bütünleşik bir sistem ortaya konmuştur. SMS spam tespiti için tezde yaptığımız çalışmalar geçmiş çalışmaların ötesine geçmiştir. Ortaya koyduğumuz entegre yapının bazı parçaları sınıflandırma performansını artırmış fakat bazıları önemli bir iyileşmeye neden olmamıştır. Kurgulanan bütünleşik yapıya rağmen iyileşmeyen tespit doğruluklarının sebebi ortaya konmuştur. Makine öğrenmesi modelleri veriye dayalı modeller olduğu için daha başarılı modeller daha zengin içerikteki veriyle mümkün olabilecektir. Spam türleri arttıkça bu spam türlerinin örnekleri ile modeller eğitilmelidir. Ayrıca sınıflandırma başarısı yüksek sınıflayıcılar seçilmeli, daha uygun parametreler ortaya konmalı, balans edilmiş veri kümeleriyle çalışılmalı, doğal dil işleme yöntemleriyle veriden içeriğe dayalı ek bilgiler çıkarılmalıdır. Çalışmamız geliştirilmeye müsaittir. Ayrıca kurguladığımız bütünleşik yapı metinsel veriler üzerinde analiz ihtiyacı olan diğer problemler için de uygundur.