YENİ TÜRKÇE DUYGUSAL VERİ SETİ ÜZERİNDE KONUŞMADAN DUYGU TANIMA
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Kayseri Üniversitesi, Lisansüstü Eğitim Enstitüsü, HESAPLAMALI BİLİMLER VE MÜHENDİSLİK ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2023
Tezin Dili: Türkçe
Öğrenci: EMEL ÇOLAKOĞLU
Danışman: Serhat Hızlısoy
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:İnsanlar arasındaki iletişimin en doğal ve hızlı yöntemi konuşmaktır. Konuşma sinyalleri konuşmanın içeriği haricinde konuşan kişinin ruh hali, yaşı, cinsiyeti, fizyolojisi ve lehçesi gibi birçok veriyi de barındırmaktadır. Duygu ise gerçekleşen bir olayın, kişilerin ya da varlıkların insanın iç dünyasında oluşturduğu etkidir. Duygular mutluluk, heyecan, öfke, sakinlik gibi gruplara ayrılabilir. Bireyler duygularını hem beden dili yoluyla hem de sesli iletişim ile birbirlerine aktarırlar. Ancak bazı durumlarda beden dilini yorumlamak ya da görebilmek mümkün olmamaktadır. Böyle durumlarda sesten duygunun çıkarımı daha fazla önem kazanmaktadır. Bu alanda yapılan ilk çalışmalarda genelde görüntü sinyallerinden duygu analizi yapılması üzerinde durulmuştur. Son yıllarda ise ses sinyali üzerinden duygu analizi çalışmaları gelişme göstermeye başlamıştır. Literatür incelendiğinde ise konuşmadan duygu tanıma alanında birçok çalışma olduğu görülmektedir. Yapılan çalışmalarda hem makine öğrenim hem de derin öğrenme algoritmaları kullanılmakta ve oldukça başarılı tanıma oranlarına ulaşılmıştır. Bu tez kapsamında ise önceki çalışmalardan farklı olarak verisetini kendimiz oluşturduk. Bunun için Türk yapımı dizi ve filmler incelendi. Veriseti içindeki tüm kayıtlar 5 saniyeden oluşmakta ve 4 duygu içermektedir. Burada tezin önceki çalışmalardan en önemli farkı konuşmadan duygu tanıma için oluşturulmuş; yüksek veri kalitesi ve etiketlendirmesine sahip olan hazır veri setlerinin kullanılmamasıdır. Ayrıca Türkçe dili üzerinde yayın yapan çok az sayıda çalışma bulunmaktadır. Diğer bir noktada konuşmacı bağımsız bir model oluşturulmuş olmasıdır. Bu durumda aslında model performansını olumsuz etkileyebilecek bir durumdur. İncelenen çalışmalarda düşük tanıma oranları nedeniyle genelde tercih edilmemiştir. Özniteliklerin çıkarılmasında OpenSMILE uygulaması kullanılmıştır. Ön işleme sürecinde sıralama, standardizasyon, resample, discretize işlemleri uygulanmıştır. Öznitelik seçme sürecinde farklı algoritmalar ve uygulamalar incelenmiş. Performansa ek bir katkı gözlemlenmediği için süreç içinde bu kısım kullanılmamıştır. Sınıflandırma sürecinde ise hem makine öğrenim hem de derin öğrenme algoritmaları kullanılmıştır. Makine öğrenim tarafında en başarılı tanıma oranı Lojistik Regresyon (%94,25) ile elde edilmiştir. Derin öğrenme tarafında ise DNN modeli (%92,57) ile yüksek tanıma oranına ulaşılmıştır. Anahtar Kelimeler: Makine Öğrenmesi, OpenSMILE, Derin Öğrenme, Konuşmadan Duygu Tanıma