Doğal Dil İşleme Modellerinde Sentaks Erozyonu: Yapay Zekâ ve Türkçe Söz Dizimi Hataları
Özet (Abstract)
Büyük dil modellerinin (ChatGPT, Gemini) eklemeli ve esnek söz dizimine (SOV) sahip Türkçe üzerindeki biçimbilimsel ve anlamsal tahribatını inceleyen uygulamalı dilbilim ve doğal dil işleme makalesi.
1. Giriş: Hesaplamalı Dilbilim ve Büyük Dil Modellerinin Yapısal Mimarisi
Üretken yapay zekâ teknolojilerinin ve Dönüştürücü (Transformer) mimarisine dayalı Büyük Dil Modellerinin (LLM) yaygınlaşması, metin üretim süreçlerini kökten dönüştürmüştür. Dijital gazetecilikten akademik makalelere, kurumsal yazışmalardan edebi denemelere kadar geniş bir alanda kullanılan bu sistemler, diller arası eşdeğerliği yalnızca istatistiki ağırlıklar ve olasılıksal belirteçler (token) üzerinden hesaplamaktadır.
Bu hesaplamalı yaklaşım, özellikle İngilizce merkezli devasa veri kümeleriyle ön eğitimden geçirilen modellerin, yapısal ve tipolojik olarak farklı dillerde ciddi sentaktik ve morfolojik kırılmalara yol açmasına neden olmaktadır. Türkçenin eklemeli morfolojisi ve serbest söz dizimi kuralları, yapay zekâ modellerinin mekanik şablonlarına zorla uyarlandığında; dilde yapay bir sentaks köleliği, kelime kadrosunda daralma ve anlamsal bağdaşıklık erozyonu meydana gelmektedir.
2. Sentaks Uyuşmazlığı: SVO (İngilizce) ile SOV (Türkçe) Çatışması
İngilizce analitik bir dil olup temel söz dizim kuralı Özne - Eylem - Nesne (Subject - Verb - Object / SVO) sırasına dayanır. Cümle içerisindeki anlamsal ilişkiler büyük ölçüde sözcük sırasına ve edatlara (prepositions) bağlıdır. Buna karşılık Türkçe; Altay dil ailesi tipolojisine uygun olarak sondan eklemeli, bükümsüz ve kural olarak Özne - Nesne - Eylem (SOV) sırasını takip eden sentetik bir dildir.
Yapay zekâ modelleri İngilizce düşünülmüş algoritmik bir mimari üzerinde çalıştığında, Türkçenin cümle yapısını İngilizcedeki SVO kalıbına yaklaştırmaya çalışır. Cümleler yüklemle bitmek yerine yapay zarf fiillerle uzatılmakta; fiilimsilerin doğal kullanımı yerine İngilizcedeki ilgi zamirlerinin (relative pronouns: which, who, that) karşılığı olarak gereksiz "ki" bağlacı veya "bu durum", "şu şekildedir" gibi sentetik bağlayıcı ögeler türetilmektedir. Bu olgu, dilbilimde sentaks köleliği veya yapısal calque (çeviri kopyası) olarak adlandırılmaktadır.
3. Prof. Dr. Asiye Mevhibe Coşar'ın Karşılaştırmalı Bulguları
Yapay zekânın Türkçe üzerindeki sentaktik sınırları, akademik çalışmalarda somut deneylerle belgelenmiştir. Prof. Dr. Asiye Mevhibe Coşar'ın "Söz Dizimi Açısından ChatGPT'nin Türkçesine Bir Bakış" başlıklı araştırması, yapay zekânın Türkçe metin kurma kabiliyetlerini ChatGPT-3 ve ChatGPT-4 modelleri üzerinden karşılaştırmalı olarak tahlil etmiştir.
Araştırma bulgularına göre ChatGPT-3 modeli, kelime haznesi ve bağlamsal türetme yetersizliği sebebiyle aşırı düzeyde döngüsel tekrara düşmektedir. Deney sırasında modele hayatın anlamı üzerine yazdırılan bir metinde şu mekanik kalıp peş peşe üç kez yinelenmiştir:
"Hayatta insanların çoğu zaman zorluklarla karşılaşır, ancak zorluklar hayatın bir parçasıdır ve bunların üstesinden gelmek bizi daha güçlü yapar."
"Hayatta insanların çoğu zaman hata yapar, ancak hata yapmak hayatın bir parçasıdır ve bunların üstesinden gelmek bizi daha zeki yapar."
"Hayatta insanların çoğu zaman mutsuz olur, ancak mutsuzluk hayatın bir parçasıdır ve bunların üstesinden gelmek bizi daha mutlu yapar."
Metnin kapanışında ise model tamamen tıkanarak "Hayatta, her şey mükemmel olmayacaktır. Ancak hayatta kalmak ve mücadele etmek, bizi daha güçlü ve daha mutlu yapar." cümlesini hiçbir kelimesini değiştirmeden arka arkaya üç kez tekrarlamıştır. Bu örnek, istatistiki bir modelin bağlam derinliği tükendiğinde sentaktik olarak nasıl kısır bir döngüye hapsolduğunu göstermektedir.
Buna karşılık eğitim verisi ve parametre hacmi genişletilen ChatGPT-4 modeli, "Hayat, bilinmezliklerle dolu bir serüven gibidir" ve "Değişim, kimi zaman korkutucu olsa da aslında büyümemizin ve gelişmemizin bir göstergesidir" gibi şartlı birleşik cümleleri kurabilmiş, bağlama uygun kelime seçimi yapabilmiştir. Ancak ChatGPT-4 dahi stilistik tekdüzelikten ve basmakalıp bağlaç kullanımından bütünüyle kurtulamamıştır.
4. Sahte Bağlaç Üretimi ve Mantıksız Edilgenlik Enflasyonu
Türkçe, fiil çekim ekleri ve şahıs eklerinin zenginliği sayesinde gizli özneyi mükemmel şekilde taşıyabilen ve anlamı tek bir yüklemde toplayabilen tasarruflu bir dildir. Yapay zekâ modelleri ise İngilizcedeki "it is because", "by doing so", "which means" ve "in terms of" gibi analitik kalıpları karşılamak amacıyla Türkçede bulunmayan yapay dolaylamalar üretmektedir.
Yapay zekâ tarafından oluşturulan metinlerde sıklıkla karşılaşılan kalıplar şunlardır:
- Gereksiz Edilgenlik: "Karar alınması gerçekleştirilmiştir" yerine doğrudan "Karar alınmıştır" veya "Karar verildi" denmesi gerekirken, cümle mekanik biçimde edilgenleştirilmektedir.
- Sahte Bağlayıcılar: "Bu durum, şuna yol açmaktadır", "Bunun nedeni ise şudur", "Şu şekilde özetlenebilir" gibi ifadelerle cümlenin akıcı sentaksı parçalanmaktadır.
- Tersine Özne-Yüklem Uyuşmazlığı: Çoğul cansız varlıkların özne olduğu durumlarda Türkçede yüklem tekil tutulması gerekirken ("Ağaçlar sarardı"), modeller İngilizce kuralı uygulayarak yüklemi çoğul yapmaktadır ("Ağaçlar sarardılar").
5. Anlamsal Bağdaşıklık Kırılması ve Leksikal Tekdüzeleşme
Yapay zekânın Türkçeye verdiği bir diğer zarar, sözcük dağarcığındaki radikal tek tipleşmedir. Doğal dil işleme kütüphaneleri, İngilizce sözcüklerin Türkçe karşılıklarını en sık kullanılan tek bir kelimeye indirgemektedir. Örneğin İngilizce "process" kelimesi görüldüğü her metinde; kurgunun veya konunun durumuna göre evre, safha, aşama, dönem, döngü veya hamle seçenekleri varken ısrarla yalnızca "süreç" sözcüğüyle karşılanmaktadır. Benzer biçimde "impact" sözcüğü sadece "etki" kelimesine indirgenmektedir.
Öte yandan Google'ın Gemini dil modellerinde ve benzer LLM'lerde gözlemlenen leksikal saplantılar; metin türü ne olursa olsun "sığ", "kof", "illüzyon", "balyoz", "buz gibi" ve "ahbap-çavuş" gibi belli başlı kelimelerin sürekli ve zorlama metaforlar hâlinde tekrar edilmesidir. Bu durum, yaşayan bir edebiyat dilinin gerektirdiği çok sesliliği ve nüansı yok ederek metinleri tek tip bir "dijital tercüme jargonu"na mahkûm etmektedir.
6. Bilişsel ve Kültürel Sonuçlar
Büyük dil modellerinin biçimbilimsel ve sentaktik deformasyonu, yalnızca teknik bir dilbilim sorunu değildir. Yeni nesil öğrencilerin, araştırmacıların ve metin yazarlarının kendi cümlelerini kurmak yerine üretimi yapay zekâya devretmesi, zihinsel dil edinim süreçlerini zayıflatmaktadır.
Türkçenin deyimler, atasözleri ve kültürel bağlamlar üzerinden kazandığı çok katmanlı soyutlama yetisi, modeller tarafından birebir çeviri (literal translation) mantığıyla mekanikleştirilmektedir. İnsan zihninin dil üretici bilişsel fonksiyonları devre dışı kaldıkça; toplum, kendi kavramlarıyla düşünen özne kimliğini kaybederek yapay zekânın sentetik şablonlarını tüketen pasif bir alıcıya dönüşme riskiyle karşı karşıya kalmaktadır.
7. Sonuç
Prof. Dr. Asiye Mevhibe Coşar'ın ve dilbilimcilerin ortaya koyduğu ampirik veriler; yapay zekânın Türkçe metin üretiminde söz dizimsel tekdüzelik, mekanik tekrarlar ve İngilizce merkezli sentaks dayatması gibi yapısal kusurlara sahip olduğunu kanıtlamaktadır. Bu teknolojik araçların kullanımında Türkçenin eklemeli yapısı, fiilimsilere dayalı cümle mimarisi ve zengin söz varlığı korunmalı; yapay zekânın ürettiği sentaktik kalıplar eleştirel bir süzgeçten geçirilmeden doğrudan dolaşıma sokulmamalıdır.
Kaynakça ve Notlar
- Coşar, A. M. (2023). Söz Dizimi Açısından ChatGPT'nin Türkçesine Bir Bakış. Karadeniz Araştırmaları, Cilt 20, Sayı 80, ss. 911-928.
- Chomsky, N. (1957). Syntactic Structures. Mouton & Co., The Hague.
- Korkmaz, Z. (2009). Türkiye Türkçesi Grameri: Şekil Bilgisi. Türk Dil Kurumu Yayınları, Ankara.
- Vaswani, A. vd. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems (NeurIPS 2017), ss. 5998-6008.
- Demir, N. & Emeksiz, A. (2018). Türk Dili: Dil ve Anlatım. Nobel Akademik Yayıncılık, Ankara.