Demo site
Nöromorfik Bilişim ve Donanım Mimarisi•Cilt 13, Sayı 2••15 dk okuma süresi

Az Kaynaklı Anadolu Ağızları İçin Parametrik ve Dalga Formu Tabanlı Nöral Ses Sentezleyicisi

Gırtlaksı ve Damaksı Ünsüz Varyasyonlarının Çoklu Hoparlörlü Difüzyon Modeliyle Korunması

Dr. Yaman Sarpel portresi
Dr. Yaman SarpelBilkent Üniversitesi UNAM, Nöromorfik Bilişim ve Donanım Grubu
DOI:https://doi.org/10.5582/yorunge.2025.13.2.13
Ses spektrogramı dalga formları ve nöral ağ katman grafiği

Konuşma difüzyon modelinin fonem bazlı dikkat matrisi ve mel-spektrogram dönüşümü. (Fotoğraf: Bilkent UNAM Ses Laboratuvarı)

Özet (Abstract)

Geleneksel metin-okuma (TTS) modelleri, standart İstanbul Türkçesi ses fonolojisine göre eğitildiklerinden, Anadolu ağızlarındaki zengin damaksı art damak seslerini, sağır nün (ñ) varyasyonlarını ve tonlama vurgularını kaybetmektedir. Bu makale, Ege, Karadeniz ve Doğu Anadolu kırsalında derlenen 180 saatlik ses kayıtları üzerinde eğitilmiş, dalga formu difüzyon mimarisine dayanan parametrik bir konuşma sentezleyicisi sunmaktadır. Model, yalnızca 3 dakikalık örneklemle yeni konuşmacıların fonetik ve diyalekt karakterini %94 benzerlikle klonlayabilmektedir.

Öne Çıkan Bulgular ve Kuramsal Çıkarımlar

  • •Kaybolma tehlikesi altındaki 14 farklı Anadolu ağzı fonetik olarak dijital arşivlenmiştir.
  • •Sistem 3 dakikalık referans ses kaydıyla hedef ağzın perde aralığını ve vurgu ritmini yakalamaktadır.
  • •Açık erişimli ağırlıklar dilbilimsel ve kültürel miras araştırmalarına açılmıştır.

Fonetik Miras ve Dijital Temsil Darboğazı

Yapay zeka ses asistanlarının yaygınlaşması, bölgesel ağızların ve nesiller arası ses tonlamalarının standart bir homojenliğe itilmesine neden olmaktadır. Özellikle Karadeniz ve Doğu Anadolu ağızlarında yer alan nefesli ötümsüz ünsüzler ve vurgu kaymaları, standart dil modellerinin telaffuz edemediği karakteristik zenginliklerdir.

Geliştirilen mimari, mel-spektrogram tahmini yapan bir dönüştürücü (transformer) gövdesi ile doğrudan zaman alanında ses üreten difüzyon dalgaformu sentezleyicisini birleştirir.

Değerlendirme ve Dinleme Testleri

Yerel konuşmacılardan oluşan 40 kişilik bir dinleme jürisiyle yapılan ortalama görüş skoru (MOS) testlerinde model 4.42/5.00 puan almıştır.

Kaynakça ve Referanslar

  1. Sarpel, Y. (2024). Preserving regional phonetic heritage via zero-shot neural diffusion. Speech Communication, 156, 103019.[DOI]
Anahtar Kelimeler:Ses SenteziAnadolu AğızlarıDifüzyon ModeliDoğal Dil İşlemeFonetik Koruma

Aynı Disiplindeki Diğer Araştırmalar

Nöromorfik Bilişim ve Donanım MimarisiCilt 14/1

Olay Tabanlı Asenkron Görüntü İşleme Sensörleri İçin Düşük Güçlü Nöromorfik Devre Düzenleri

Dr. Yaman Sarpel

Geleneksel kare (frame) tabanlı kameralar saniyede sabit sayıda görüntü yakalayarak büyük miktarda gereksiz veri üretirken, olay tabanlı dinamik vizyon sensörleri (DVS) yalnızca sahnedeki piksel düzeyindeki logaritmik parlaklık değişimlerini zaman damgasıyla asenkron iletmektedir. Bu makale, 65 nm CMOS prosesinde üretilen ve piksel başına yalnızca 4.2 pikojul enerji tüketen 128x128 spiking nöral işlemci mimarisini sunmaktadır.

17 dk
171670