Kısa Metinlerde Makine Öğrenmesi Yöntemleriyle Yüksek Performanslı Dil Tanıma
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Sivas Cumhuriyet Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2024
Tezin Dili: Türkçe
Öğrenci: Berfin Aydın
Danışman: Hidayet Takcı
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Dil tanıma doğal dil işlemede öne çıkan çalışma başlıklarından birisidir. Bugüne kadar manuel, otomatik ya da yarı otomatik yöntemlerle yerine getirilmiştir. Son dönemde artan metin boyutları ve miktarı nedeniyle makine öğrenmesi tabanlı dil tanıma çalışmalarında bir artış meydana gelmiştir. Özellikle sosyal medya üzerinde paylaşılan metinler gibi kısa boyutlu metinlerde dil tanıma her geçen gün daha fazla önem kazanan bir konudur. Bu çalışmada beş farklı makine öğrenmesi algoritması Python programlama dili imkânları ile çalıştırılmıştır. Dil tanıma verisi olarak Hugging Face tarafından oluşturulan Papluca veri seti kullanılmıştır. Veri setinde yer alan 20 farklı dile ait örnekler kısa boyutlu metinlerden meydana gelmektedir. Dil tanımada en yüksek doğruluğu %97,0 ile Lojistik Regresyon algoritması vermiştir. Lojistik regresyon algoritmasını Karar Ağacı algoritması takip etmiştir. Elde edilen en düşük sınıflandırma doğruluğunu %47,0 ile Tf-idf vektörize yöntemini kullanan K-En Yakın Komşu algoritması vermiştir. Yapılan çalışmalardan elde edilen en değerli bulgu; dil tanıma doğruluklarına dilin kendisinin, kullanılan makine öğrenmesi algoritmalarının ve kullanılan vektörize yönteminin etki etmesidir. Çalışmamız dil tanıma alanında çalışacaklara yardımcı olacak içerikte hazırlanmıştır. Anahtar kelimeler: Dil tanıma, makine öğrenmesi, sınıflandırma, metin sınıflandırma