Fatih TORUN-
Kategorematik ve sinkategorematik ifadeler ayrımı, Ortaçağ skolastik mantığından günümüz dilbilimine uzanan kavramsal bir mirastır. Bu ayrım, sözcükleri bağımsız anlam taşıyıp taşımadıklarına göre iki büyük sınıfa ayırır. Türkçenin eklemeli tipolojisi, söz konusu ayrımın yalnızca sözcük düzeyinde değil, biçimbirim düzeyinde de incelenmesini gerekli kılar. Çünkü Türkçede sinkategorematik işlev, büyük ölçüde durum, zaman, iyelik ve kip gibi bağlı ekler aracılığıyla yerine getirilir.
Bu çalışma, Sadettin Özçelik’in Dede Korkut - Dresden Nüshası: Metin, Dizin (TDK Yayınları, 2016) adlı eleştirel neşrini birincil korpus olarak ele alır. Dresden nüshasının 12 hikâye ve bir mukaddime bölümünden oluşan 26.254 kelimelik metni, yedi katmanlı bir biçimbirimsel ayrıştırma yöntemiyle analiz edilmiştir. Latin transkripsiyonlu çift numaralı sayfalar, tesseract-ocr aracılığıyla Türkçe dil modeli kullanılarak 200 dpi çözünürlükte dijitalleştirilmiş; 240 folyo üzerinden hikâye bazında bir korpus oluşturulmuştur. Diakronik karşılaştırma için 2009 tarihli dijital bir Türkiye Türkçesi aktarımı, 8 hikâye ve 22.862 kelimeyle ikincil korpus olarak kullanılmıştır.
Bulgular, XVI. yüzyıl Oğuz Türkçesi korpusunda 2.824 bağımsız sinkategorematik sözcüğün yanı sıra 25.020 bağlı biçimbirimin yer aldığını göstermektedir. Böylece birleşik sinkategorematik yük 27.844 birime ulaşmakta ve kelime başına 1,06 yoğunluk değerine karşılık gelmektedir. Diakronik karşılaştırmada -uban zarf-fiili (XVI. yüzyılda 60 kullanım, XXI. yüzyılda hiç), -gıl/-gil emir eki (226’dan 19’a) ve -durur bildirme eki (762’den 80’e) gibi arkaik yapıların önemli ölçüde işlevsizleştiği görülmüştür. Buna karşılık -dır bildirme eki (258’den 486’ya) ile -arak, -madan ve -mıştı gibi yeni biçimlerin yükseldiği tespit edilmiştir. mere, dahı, karşu, meger ve içün gibi bağımsız sinkategorematik sözcüklerin de büyük ölçüde arkaikleştiği görülmektedir.
Bu örüntüler, kategorematik-sinkategorematik sınırının Hopper ve Traugott’un (2003) dilbilgiselleşme çerçevesinde kavramsallaştırdığı biçimde zaman içinde değişken olduğunu gösterir. Dede Korkut metni, bu yönüyle Türkçenin 500 yıllık diakronik sürecinde değerli bir kesit sunmaktadır.
The distinction between categorematic and syncategorematic expressions, inherited from medieval scholastic logic and extending into contemporary linguistics, divides words into two broad classes according to whether they carry independent meaning or function only in combination with other terms. The agglutinative typology of Turkish makes it necessary to examine this distinction not only at the word level but also at the morpheme level, since syncategorematic function in Turkish is predominantly realised through bound affixes such as case, tense, possession, and modality markers.
This study takes Sadettin Özçelik’s critical edition Dede Korkut - Dresden Manuscript: Text, Index (TDK Publications, 2016) as its primary corpus and analyses the 26,254-word text of the Dresden manuscript, comprising twelve stories and one introduction, through a seven-layered morpheme-stripping method. The Latin-transcribed even-numbered pages were digitised via tesseract-ocr, using the Turkish language model at 200 dpi resolution, and a story-based corpus was constructed from 240 folios. For diachronic comparison, a 2009 digital Modern Turkish rendition, consisting of eight stories and 22,862 words, served as the secondary corpus.
The findings show that the XVIth-century Oghuz Turkish corpus contains 2,824 independent syncategorematic words alongside 25,020 bound morphemes. This yields a combined syncategorematic load of 27,844 units and a density of 1.06 per word. Diachronic comparison shows that archaic forms such as the -uban gerund (60 instances in the XVIth century, none in the XXIst), the -gıl/-gil imperative suffix (dropping from 226 to 19), and the -durur copular marker (from 762 to 80) have largely become non-functional. Meanwhile, the -dır copular marker (from 258 to 486) and new forms such as -arak, -madan, and -mıştı have risen sharply. Independent syncategorematic words such as mere, dahı, karşu, meger, and içün were also found to have become largely archaic.
These patterns demonstrate that the categorematic-syncategorematic boundary is historically dynamic in the sense conceptualised by Hopper and Traugott (2003) within the framework of grammaticalisation. They also show that the Dede Korkut text offers a privileged cross-section of Turkish’s 500-year diachronic development.
Dede Korkut, syncategorematic expressions, morphological analysis, Oghuz Turkish, grammaticalisation, Özçelik 2016, historical linguistics.
Structed Abstract:
The categorematic-syncategorematic distinction inherited from medieval scholastic logic partitions words into two classes by whether they carry meaning on their own. Categorematic terms (nouns, adjectives, verbs) are independent semantic units and can function as subjects or predicates. Syncategorematic terms (postpositions, conjunctions, inflectional suffixes) acquire meaning only in combination with other terms. The distinction goes back to the notion of prossēmainein in Aristotle's De Interpretatione, took shape through Boethius's Latin transmission, and was systematised in the manuals of William of Sherwood and Pedro Hispano (Kretzmann, 1982; Klima, 2006). Modern formal semantics, philosophy of language, and linguistics inherited the same partition. It sits today in the theoretical background of debates on logical constants (MacFarlane, 2015) and of linguistic work on function words and bound morphemes.
How the distinction applies, however, varies sharply across typological profiles. In analytic languages such as Latin and English, syncategorematic function is mostly carried by independent words. In agglutinative languages such as Turkish, much of that work is done by bound morphemes attached to a root. Case, tense, possessive, modal, participial, and gerundial suffixes carry no meaning on their own. Together with their host root they encode the relational role of the word in the clause. This typological feature makes it necessary to examine the syncategorematic profile of Turkish texts at the morpheme level, not only at the word level.
The Dede Korkut stories are a canonical collection of Oghuz narratives that documents the transition from Old Anatolian Turkish to Ottoman Turkish at the meeting point of oral tradition and written culture (Ergin, 1989; Gökyay, 2000; Tezcan, 2001). A third manuscript, alongside the long-known Dresden and Vatican copies, was introduced to the scholarly community by Prof. Dr. Metin Ekici at the symposium held in Bayburt on 25-27 April 2019. The 31-folio manuscript, originating from the Gonbad-e Kāvus region of the Iranian province of Golestan, is dated to the eighteenth century on linguistic grounds (Ekici, 2019). Most studies of Dede Korkut concentrate on literary, thematic, or culture-historical questions. The morphological profile, and specifically the quantitative distribution of syncategorematic morphemes, has not yet been examined in detail. The primary aim of this study is to provide such a morpheme-level inventory on the basis of Özçelik's (2016) critical edition of the Dresden manuscript. Its secondary aim is to compare the sixteenth-century data with a modern Turkish rendition and determine quantitatively which forms have become non-functional, which have risen, and which have stayed stable over a 500-year span. This second aim turns the study into a grammaticalisation reading rather than a narrowly conceived inventory.
The primary corpus is the second volume of Özçelik's (2016) Dede Korkut - Dresden Manuscript: Text, Index, published by the Turkish Language Society. The 279 even-numbered pages of Latin transcription (pp. 42-598) were processed. Each page was converted to JPEG at 200 dpi resolution via pdftoppm and then run through tesseract-ocr (version 5.3.4) with the Turkish language model. Footnotes, page headers, folio markers, and unnumbered lines were filtered automatically; only numbered main-text lines were retained. The procedure yielded a 26,254-word corpus drawn from 240 folios. Philological special characters were reduced to standard Latin letters. The OCR error rate was estimated at roughly 2-4% by manual sampling. For diachronic comparison, a 2009 digital Modern Turkish rendition covering eight stories and 22,862 words served as the secondary corpus.
A seven-layer regex-based morpheme stripper was developed specifically for the research. The stripper applies right-to-left stripping under the longest-match principle, with a minimum root length of two phonemes. The layers, in order, are: privative/derivational suffixes, the plural suffix, possessive suffixes, case suffixes, participial and gerundial suffixes, tense and modal suffixes, and person/interrogative/copular suffixes. Oghuz Turkish archaic forms were also added to the affix list: -uban/-üben (gerund), -ubanı, -gıl/-gil (2sg imperative), -dügüm, -dukda, -durur/-dur, -iser/-ısar, -ayum/-eyüm, -madın/-medin. Independent syncategorematic words were classified into eight categories: conjunctions, quantifiers, negation and non-existence words, determiners, postpositions, interrogative particles, mood-imperative-optative markers, and interjections/forms of address. The classification extends the morphological ranking that Korkmaz (2014) proposes for Turkey Turkish so as to accommodate forms specific to Oghuz Turkish. Statistical evaluation rests on rates normalised per 1,000 words, chi-square tests of independence, and Zipf-slope analysis.
The sixteenth-century corpus contains 2,824 independent syncategorematic words and 25,020 bound morphemes. The combined syncategorematic load is 27,844 units and the per-word density is 1.06. Story-level density values cluster in a narrow band between 1.00 and 1.15; this consistency indirectly supports the single-scribe assumption. Among bound morphemes, case suffixes account for 43.8% of the total load, tense suffixes for 22.0%, and participial suffixes for 11.3%. The most frequent bound morpheme is the accusative -i (3,691 instances, 140.6 per 1,000 words). It is followed by the witnessed-past -dı/-di (3,546, 135.1) and the dative -a/-e (3,468, 132.1). The Oghuz-Turkish genitive/possessive form -ün appears 2,320 times in fourth place and marks an Oghuz dialectal trace that has not evolved into the Modern Turkish -in. The most frequent independent syncategorematics are bir (281), ne (196), ve (145), bu (139), göre (127), mere (124), ol (118), and dahı (114).
The diachronic comparison brings out three distinct patterns of change. First, archaic suffixes have largely become non-functional. The -uban gerund falls from 60 to 0, the -gıl/-gil imperative from 226 to 19, the participle + possessive -dügüm from 59 to 12, and the copular -durur from 762 to 80. Second, modern forms rise sharply. The clitic copular -dır goes from 258 to 486, more than doubling. The optative -ayım/-alım rises from 3 to 134, the gerund -madan from 2 to 41, the reported-past + narrative -mıştı combination from 0 to 65, and the modern gerund -arak from 9 to 51. Third, several independent syncategorematic words become entirely archaic. mere (124 > 0), dahı (114 > 0), karşu (51 > 0), meger (36 > 0), and içün (28 > 0) are absent from the modern rendition; the distal demonstrative ol drops from 118 to 5. In statistical terms, the chi-square test returns p < 0.001 for the case, tense, and participial categories. The story-based density values have a standard deviation of σ = 0.042, indicating high morphological homogeneity. The Zipf slopes (independent syncat. ≈ -0.95; suffixes ≈ -1.08) match the expected linguistic distribution profile.
The findings show that the categorematic-syncategorematic boundary moves along three distinct trajectories in Turkish. First, the transition from categorematic to syncategorematic. The shift from the full verb durur to the shortened suffix -dır is a direct instance of the cline "content word > grammatical word > clitic > inflectional affix" set out by Hopper and Traugott (2003). The Dede Korkut text holds both ends of this cline in synchronic co-presence. It thereby offers a frozen photograph of the phonological erosion process. Second, formal replacement among syncategorematic categories. -arak takes over from -uban, -dığım from -dügüm, -ayım from -ayum. The grammatical function persists; only the form has changed. Third, the wholesale archaisation of syncategorematic words. mere, dahı, karşu, meger, and içün drop out of the modern language altogether. This shows that the syncategorematic class can renew itself in function as well as in form. The agglutinative typology of Turkish further requires that this analysis go below the word level. A word-level analysis under-represents the syncategorematic load of Turkish. The morpheme-level extension documents that the load is comparable to analytic languages such as English. Typology determines not the size of this load but where it is carried. In the end, the Dede Korkut text is a living photograph of syncategorematic transformation across 500 years of Turkish. The method developed here is a template applicable to other historical texts such as Divânü Lügâti't-Türk, Kutadgu Bilig, and the Divan of Yunus Emre. It thereby lays the groundwork for mapping the thousand-year morphological development of Turkish.
Keywords: Dede Korkut, syncategorematic expressions, morphological analysis, grammaticalisation, Old Anatolian Turkish, historical linguistics, Hopper-Traugott, corpus linguistics, agglutinative typology, -dır copular suffix.
Yapılandırılmış Özet:
Ortaçağ skolastik mantığının kurduğu kategorematik-sinkategorematik ayrımı, sözcükleri tek başına anlam taşıyıp taşımadıklarına göre iki sınıfa böler. Kategorematik terimler bağımsız anlam birimleridir: isim, sıfat, fiil. Öznesi ya da yüklemi olabilirler. Sinkategorematik terimler ise edat, bağlaç ve çekim eki gibi unsurlardır; ancak başka terimlerle birlikte işlev kazanır. Aristoteles'in De Interpretatione'sinde prossēmainein kavramıyla işaret edilen, Boethius'un Latin aktarımıyla yerleşen ve William of Sherwood ile Pedro Hispano'nun ders kitaplarında sistemleşen bu ayrım (Kretzmann, 1982; Klima, 2006), modern dönemde formel anlambilim, dil felsefesi ve dilbilime aktarılmıştır. Bugün hem mantıksal sabitler tartışmasının (MacFarlane, 2015) hem de işlev sözcükleri ve bağlı biçimbirimler üzerine yapılan dilbilim çalışmalarının kuramsal arka planında bu ayrım durur.
Ayrımın uygulanışı tipolojik profili farklı diller arasında belirgin biçimde değişir. Latince veya İngilizce gibi çözümleyici dillerde sinkategorematik işlev çoğunlukla bağımsız sözcüklerle taşınır. Türkçe gibi eklemeli dillerde ise bu işlevin büyük bölümü, köke eklenen bağlı biçimbirimlerle yerine getirilir. Durum, zaman, iyelik, kip, sıfat-fiil ve zarf-fiil ekleri tek başına anlam üretmez. Bağlandıkları kökle birlikte cümle içi ilişkisel rolü kurarlar. Bu nedenle Türkçe metinlerin sinkategorematik profili yalnızca sözcük düzeyinde değil, biçimbirim düzeyinde de incelenmelidir.
Dede Korkut hikâyeleri, Eski Anadolu Türkçesinden Osmanlı Türkçesine geçiş dönemini sözlü gelenekle yazılı kültürün buluştuğu kavşakta belgeleyen kanonik bir Oğuzname derlemesidir (Ergin, 1989; Gökyay, 2000; Tezcan, 2001). Eserin Dresden ve Vatikan nüshalarına eklenen üçüncü el yazması, Prof. Dr. Metin Ekici tarafından 25-27 Nisan 2019'da Bayburt'ta düzenlenen sempozyumda bilim dünyasına tanıtılmıştır. İran'ın Gülistan eyaletindeki Günbed-i Kâbus bölgesinden çıkan 31 yapraklık bu nüsha, dil özelliklerine göre XVIII. yüzyıla tarihlendirilir (Ekici, 2019). Bununla birlikte, Dede Korkut üzerine yapılan çalışmaların büyük çoğunluğu edebî, tematik ya da kültür-tarihsel değerlendirmelere odaklanmıştır. Morfolojik profil, özellikle sinkategorematik biçimbirimlerin nicel dağılımı, bugüne kadar ayrıntılı biçimde ele alınmamıştır. Bu çalışmanın birincil amacı, Özçelik'in (2016) eleştirel neşrini temel alarak Dresden nüshasındaki kategorematik ve sinkategorematik ifadelerin nicel dökümünü çıkarmaktır. İkincil amaç ise XVI. yüzyıl verisini bir modern Türkçe aktarımla karşılaştırarak 500 yıllık süreçte hangi yapıların işlevsizleştiğini, hangilerinin yükseldiğini ve hangilerinin istikrar gösterdiğini belirlemektir. Bu ikinci amaç, çalışmaya dar anlamda bir envanter olmanın ötesinde bir dilbilgiselleşme okuması niteliği kazandırır.
Çalışmanın birincil korpusu, Özçelik'in (2016) Türk Dil Kurumu Yayınları arasında çıkan Dede Korkut - Dresden Nüshası: Metin, Dizin adlı iki ciltlik eserinin ikinci cildidir. Çift numaralı sayfalardaki Latin transkripsiyonlu metin, yani 42-598 arası 279 sayfa incelenmiştir. Bu sayfalar önce pdftoppm ile 200 dpi çözünürlükte JPEG'e dönüştürülmüştür. Ardından tesseract-ocr (sürüm 5.3.4) Türkçe dil modeliyle optik karakter tanıma işlemine tabi tutulmuştur. Dipnotlar, sayfa başlıkları, folyo işaretleri ve numarasız satırlar otomatik filtrelenmiş; yalnızca numaralandırılmış ana metin satırları korunarak 240 folyo üzerinden 26.254 kelimelik bir korpus oluşturulmuştur. Filolojik özel karakterler standart Latin harflerine indirgenmiştir. OCR hata oranı manuel sayımla yaklaşık %2-4 olarak tahmin edilmiştir. Diakronik karşılaştırma için 8 hikâye ve 22.862 kelimeden oluşan 2009 tarihli dijital bir modern Türkçe aktarım ikincil korpus olarak kullanılmıştır.
Biçimbirim ayrıştırması için araştırmaya özgü yedi katmanlı bir regex tabanlı çözümleyici geliştirilmiştir. Çözümleyici en uzun eşleşme ilkesine göre sağdan sola soyma yapar. Minimum kök uzunluğu iki ses birimi olarak belirlenmiştir. Katmanlar sırasıyla şunlardır: yokluk/varlık türetme ekleri, çoğul eki, iyelik ekleri, durum ekleri, fiilimsi ekleri, zaman ve kip ekleri, kişi/soru/bildirme ekleri. Oğuz Türkçesine özgü arkaik biçimler de ek listesine eklenmiştir: -uban/-üben (zarf-fiil), -ubanı, -gıl/-gil (2. tekil emir), -dügüm, -dukda, -durur/-dur, -iser/-ısar, -ayum/-eyüm, -madın/-medin. Bağımsız sinkategorematik sözcükler sekiz kategoride değerlendirilmiştir: bağlaçlar, niceleyiciler, olumsuzlama ve yokluk sözcükleri, belirleyiciler, edatlar, soru edatları, kip-emir-istek belirteçleri ve ünlem/hitap sözcükleri. Sınıflandırma, Korkmaz'ın (2014) Türkiye Türkçesi şekil bilgisi sıralamasını Oğuz Türkçesine özgü biçimleri kapsayacak biçimde genişletir. İstatistiksel değerlendirme için 1000 kelimeye normalize edilmiş oranlar, ki-kare bağımsızlık testi ve Zipf eğimi analizi kullanılmıştır.
XVI. yüzyıl korpusunda 2.824 bağımsız sinkategorematik sözcük ve 25.020 bağlı biçimbirim tespit edilmiştir. Birleşik sinkategorematik yük 27.844 birim, kelime başına yoğunluk ise 1,06'dır. Hikâye bazında yoğunluk değerleri 1,00 ile 1,15 arasında dar bir bantta dağılmıştır; bu istikrar tek yazıcı varsayımını dolaylı olarak destekler. Bağlı biçimbirimler arasında durum ekleri toplam yükün %43,8'ini, zaman ekleri %22,0'ını, fiilimsi ekleri ise %11,3'ünü oluşturur. En sık bağlı biçimbirim belirtme hâli -i ekidir (3.691 kullanım, 1000 kelimeye 140,6). Onu görülen geçmiş zaman -dı/-di (3.546, 135,1) ve yönelme hâli -a/-e (3.468, 132,1) izler. Oğuz Türkçesine özgü ilgi/iyelik biçimi -ün, 2.320 kullanımla dördüncü sırada yer alır ve modern Türkçenin -in biçimine evrilmemiş Oğuz lehçe izinin bir göstergesidir. Bağımsız sinkategorematikler arasında en sık biçimler şunlardır: bir (281), ne (196), ve (145), bu (139), göre (127), mere (124), ol (118), dahı (114).
Diakronik karşılaştırma üç belirgin değişim örüntüsü ortaya koymuştur. Birincisi, arkaik eklerin büyük ölçüde işlevsizleşmesidir. -uban zarf-fiili 60'tan 0'a, -gıl/-gil emir eki 226'dan 19'a, -dügüm sıfat-fiil + iyelik birleşimi 59'dan 12'ye, -durur bildirme eki ise 762'den 80'e gerilemiştir. İkincisi, modern biçimlerin keskin yükselişidir. Klitik -dır bildirme eki 258'den 486'ya iki kattan fazla artmıştır. -ayım/-alım istek eki 3'ten 134'e, -madan zarf-fiili 2'den 41'e, -mıştı duyulan geçmiş + hikâye birleşimi 0'dan 65'e, modern -arak zarf-fiili 9'dan 51'e çıkmıştır. Üçüncüsü, bazı bağımsız sinkategorematik sözcüklerin tamamen arkaikleşmesidir. mere (124 > 0), dahı (114 > 0), karşu (51 > 0), meger (36 > 0) ve içün (28 > 0) modern aktarımda hiç görülmemektedir. ol uzak işaret zamiri de 118'den 5'e düşmüştür. İstatistiksel değerlendirmede ki-kare testi durum, zaman ve fiilimsi kategorilerinde p < 0,001 düzeyinde anlamlı fark vermiştir. Hikâye bazında yoğunluk değerlerinin standart sapması σ=0,042 ile yüksek bir morfolojik homojenliğe işaret etmiştir. Zipf eğimleri (bağımsız sinkat. ≈ -0,95; ekler ≈ -1,08) beklenen dilsel dağılım profiliyle uyumlu çıkmıştır.
Bulgular, kategorematik-sinkategorematik sınırının Türkçede üç farklı biçimde hareket ettiğini göstermektedir. Birincisi, kategorematikten sinkategorematiğe geçiştir. durur fiilinin tam biçiminden kısalmış -dır ekine doğru olan dönüşüm, Hopper ve Traugott'un (2003) tanımladığı "içerik sözcüğü > gramatik sözcük > klitik > çekim eki" zincirinin doğrudan bir örneğidir. Dede Korkut metni bu zincirin hem başlangıç hem de son biçimlerini eşzamanlı barındırır. Bu yönüyle fonolojik aşınma sürecinin fotoğraflandığı önemli bir noktada durur. İkincisi, sinkategorematik kategoriler arasındaki biçim değişimidir. -uban zarf-fiilinin yerini -arak'a, -dügüm yapısının -dığım'a, -ayum'un -ayım'a bırakması, dilbilgisel işlevin korunduğu ancak biçimin değiştiği örneklerdir. Üçüncüsü, sinkategorematik sözcüklerin tamamen arkaikleşmesidir. mere, dahı, karşu, meger ve içün sözcüklerinin modern dilden çekilmesi, sinkategorematik sınıfın yalnızca biçim bakımından değil işlev bakımından da yenilenebileceğini gösterir. Türkçenin eklemeli tipolojisi içinde sözcük düzeyinde yapılan analiz dilin gerçek sinkategorematik yükünü eksik temsil eder. Morfolojik düzeyde genişletilmiş analiz, bu yükün İngilizce gibi çözümleyici dillerle karşılaştırılabilir olduğunu belgeler. Tipolojik özellik bu yükün miktarını değil, nerede taşındığını belirler. Sonuç olarak Dede Korkut metni, Türkçenin 500 yıllık diakronik sürecinde sinkategorematik dönüşümün canlı bir fotoğrafını sunar. Çalışma yöntemsel olarak Divânü Lügâti't-Türk, Kutadgu Bilig ve Yunus Emre Divânı gibi diğer tarihsel metinlere uygulanabilir bir şablon ortaya koymaktadır. Böylece Türk dilinin bin yıllık morfolojik gelişiminin haritalanmasına zemin hazırlanmıştır.
Anahtar Kelimeler: Dede Korkut, sinkategorematik ifadeler, morfolojik analiz, dilbilgiselleşme, Eski Anadolu Türkçesi, tarihsel dilbilim, Hopper-Traugott, korpus dilbilim, eklemeli tipoloji, -dır bildirme eki.
الملخص المنهجي
إن التمييز بين الألفاظ الكاتيجوريماتية (Categorematic) والسينكاتيجوريماتية (Syncategorematic) الموروث من المنطق المدرسي الوسيط يقسّم الكلمات إلى فئتين بحسب ما إذا كانت تحمل معنى مستقلًا بذاتها. فالألفاظ الكاتيجوريماتية (الأسماء، الصفات، الأفعال) وحدات دلالية مستقلة يمكن أن تعمل كموضوع أو محمول، بينما الألفاظ السينكاتيجوريماتية (الأدوات، الروابط، اللواحق الصرفية) لا تكتسب معناها إلا بالاقتران مع غيرها. ويعود هذا التمييز إلى مفهوم prossēmainein عند أرسطو في كتابه في العبارة، ثم تبلور عبر النقل اللاتيني لبوئثيوس، وتُنظّم في كتب وليم الشيروودي وبيدرو هيسبانو (Kretzmann، 1982؛ Klima، 2006). وقد ورث علم الدلالة الصوري الحديث وفلسفة اللغة واللسانيات هذا التقسيم، وهو حاضر اليوم في خلفية النقاشات حول الثوابت المنطقية (MacFarlane، 2015) وفي الدراسات اللغوية حول الكلمات الوظيفية واللواحق.
غير أن تطبيق هذا التمييز يختلف اختلافًا حادًا بحسب البروفايل النمطي للغات. ففي اللغات التحليلية مثل اللاتينية والإنجليزية، تُحمَل الوظيفة السينكاتيجوريماتية غالبًا على كلمات مستقلة، بينما في اللغات الإلصاقية مثل التركية، يُؤدَّى معظم هذا العمل بواسطة لواحق مرتبطة بالجذر. فلاحقة الحالة، والزمن، والملكية، والمودال، والاسم المصدري، والاسم المفعولي لا تحمل معنى مستقلًا، وإنما مع الجذر تُشفّر الدور العلائقي للكلمة في الجملة. وهذا يقتضي فحص البروفايل السينكاتيجوريماتي للنصوص التركية على مستوى المورفيم، لا على مستوى الكلمة فقط.
قصص دده قورقوت مجموعة معيارية من الروايات الأوغوزية توثّق الانتقال من التركية الأناضولية القديمة إلى التركية العثمانية عند نقطة التقاء التقليد الشفوي بالثقافة المكتوبة (Ergin، 1989؛ Gökyay، 2000؛ Tezcan، 2001). وقد قُدِّم مخطوط ثالث إلى المجتمع العلمي على يد البروفيسور الدكتور متين إكيتشي في ندوة بايبورت (25-27 أبريل 2019). يتألف المخطوط من 31 ورقة مصدره منطقة Gonbad-e Kāvus في محافظة Golestan الإيرانية، ويؤرَّخ إلى القرن الثامن عشر استنادًا إلى المعايير اللغوية (Ekici، 2019). ومعظم الدراسات حول دده قورقوت تركز على القضايا الأدبية أو الموضوعية أو الثقافية-التاريخية، أما البروفايل المورفولوجي، وخاصة التوزيع الكمي للمورفيمات السينكاتيجوريماتية، فلم يُدرس بعد بالتفصيل. الهدف الأساسي لهذا البحث هو تقديم جرد مورفيمي على أساس طبعة أوزجليك النقدية (2016) لمخطوط درسدن. والهدف الثانوي هو مقارنة بيانات القرن السادس عشر بنص تركي حديث لتحديد أي الصيغ فقدت وظيفتها، وأيها ارتفع، وأيها بقي ثابتًا عبر خمسة قرون. وهذا الهدف الثاني يحوّل الدراسة إلى قراءة في التدرج النحوي (grammaticalisation) أكثر من مجرد جرد وصفي.
المتن الأساسي هو المجلد الثاني من طبعة أوزجليك (2016) مخطوط درسدن – نص وفهرس الصادر عن جمعية اللغة التركية. تمت معالجة الصفحات المرقمة زوجيًا (42-598)، أي 279 صفحة، بتحويلها إلى صور JPEG بدقة 200 dpi عبر pdftoppm ثم تشغيلها عبر tesseract-ocr (الإصدار 5.3.4) بنموذج اللغة التركية. جرى ترشيح الحواشي والعناوين والعلامات الفوليوية والأسطر غير المرقمة آليًا، ولم يُحتفظ إلا بالأسطر الرئيسة المرقمة. نتج عن ذلك متن من 26,254 كلمة مأخوذة من 240 ورقة. حُوّلت الرموز الفيلولوجية إلى حروف لاتينية قياسية، وقدّر معدل الخطأ في التعرف الضوئي بين 2-4% عبر العينة اليدوية. وللمقارنة الزمنية استُخدم نص رقمي حديث (2009) يضم ثماني قصص و22,862 كلمة.
طُوّر برنامج تجريدي مورفيمي مؤلف من سبع طبقات يعتمد على regex، ويعمل من اليمين إلى اليسار وفق مبدأ أطول تطابق مع طول جذر أدنى من فونيمين. الطبقات هي: اللواحق الاشتقاقية/الحرمانية، لاحقة الجمع، لواحق الملكية، لواحق الحالة، لواحق الاسم المصدري والاسم المفعولي، لواحق الزمن والمودال، ولواحق الشخص/الاستفهام/الكوبولا. أُضيفت أيضًا صيغ أوغوزية قديمة مثل: -uban/-üben (مصدر)، -ubanı، -gıl/-gil (أمر للمفرد)، -dügüm، -dukda، -durur/-dur، -iser/-ısar، -ayum/-eyüm، -madın/-medin. وصُنّفت الكلمات السينكاتيجوريماتية المستقلة في ثماني فئات: الروابط، الكميات، ألفاظ النفي والعدم، المحددات، الأدوات، أدوات الاستفهام، علامات المودال/الأمر/التمني، والنداءات/ألفاظ المخاطبة. تمتد هذه التصنيفات على التصنيف المورفولوجي الذي يقترحه كوركماز (2014) للتركية الحديثة لتشمل صيغ أوغوزية خاصة. التقييم الإحصائي يعتمد على المعدلات المعيارية لكل 1000 كلمة، واختبار كاي-تربيع للاستقلالية، وتحليل ميل زييف.
يحتوي متن القرن السادس عشر على 2,824 كلمة سينكاتيجوريماتية مستقلة و25,020 مورفيمًا مرتبطًا. الحمل السينكاتيجوريماتي الكلي هو 27,844 وحدة والكثافة لكل كلمة 1.06. تتجمع القيم على مستوى القصة بين 1.00 و1.15؛ وهذه الاتساقية تدعم فرضية الكاتب الواحد. بين اللواحق المرتبطة، تشكل لواحق الحالة 43.8% من الحمل الكلي، ولواحق الزمن 22.0%، ولواحق الاسم المفعولي 11.3%. أكثر المورفيمات شيوعًا هو المفعول به -i (3,691 مرة، 140.6 لكل 1000 كلمة)، يليه الماضي المشهود -dı/-di (3,546، 135.1)، ثم الداتيف -a/-e (3,468، 132.1). وتظهر صيغة الملكية الأوغوزية -ün 2,320 مرة في المرتبة الرابعة، وهي أثر لهجي لم يتطور إلى -in في التركية الحديثة. أما أكثر الكلمات السينكاتيجوريماتية المستقلة فهي: bir (281)، ne (196)، ve (145)، bu (139)، göre (127)، mere (124)، ol (118)، و dahı (114).
تُظهر المقارنة الزمنية ثلاثة أنماط تغيير مميزة. أولًا، اللواحق القديمة فقدت وظيفتها إلى حد كبير: مصدر -uban من 60 إلى 0، أمر -gıl/-gil من 226 إلى 19، تركيب -dügüm من 59 إلى 12، والكوبولا -durur من 762 إلى 80. ثانيًا، الصيغ الحديثة ارتفعت بحدة: الكوبولا -dır من 258 إلى 486، صيغة التمني -ayım/-alım من 3 إلى 134، المصدر -madan من 2 إلى 41، تركيب الماضي المنقول + السرد -mıştı من 0 إلى 65، والمصدر الحديث -arak من 9 إلى 51. ثالثًا، بعض الكلمات السينكاتيجوريماتية المستقلة أصبحت أثرية بالكامل: mere (124 > 0)، dahı (114 > 0)، karşu (51 > 0)، meger (36 > 0)، içün (28 > 0)، بينما الضمير البعيد ol انخفض من 118 إلى 5. إحصائيًا، يعيد اختبار كاي-تربيع قيمة p < 0.001 لفئات الحالة والزمن والاسم المفعولي. الانحراف المعياري لقيم الكثافة على مستوى القصة σ = 0.042، مما يدل على تجانس مورفولوجي مرتفع. أما ميل زييف (≈ -0.95 للكلمات المستقلة؛ ≈ -1.08 للواحق) فيطابق البروفايل اللغوي المتوقع
النص المقارن عبر الزمن يكشف عن ثلاثة أنماط مميزة من التغيّر. أولاً، اللواحق القديمة فقدت وظيفتها إلى حدّ كبير. فالمصدر -uban ينخفض من 60 إلى 0، وصيغة الأمر -gıl/-gil من 226 إلى 19، والمصدر مع ضمير الملكية -dügüm من 59 إلى 12، واللاحقة الرابطة -durur من 762 إلى 80. ثانياً، الأشكال الحديثة ترتفع بشكل ملحوظ. فاللاحقة الرابطة -dır ترتفع من 258 إلى 486، أي أكثر من الضعف. وصيغة التمني -ayım/-alım ترتفع من 3 إلى 134، والمصدر -madan من 2 إلى 41، وتركيب الماضي المنقول + السرد -mıştı من 0 إلى 65، والمصدر الحديث -arak من 9 إلى 51. ثالثاً، عدد من الكلمات المستقلة ذات الوظيفة النحوية تصبح عتيقة تماماً. mere (124 > 0)، dahı (114 > 0)، karşu (51 > 0)، meger (36 > 0)، و içün (28 > 0) تغيب عن النسخة الحديثة؛ والاسم الإشاري البعيد ol ينخفض من 118 إلى 5. من الناحية الإحصائية، اختبار كاي-تربيع يُظهر قيمة p < 0.001 في فئات الحالة، الزمن، والمصدر. قيم الكثافة المستندة إلى القصة لها انحراف معياري σ = 0.042، مما يدل على تجانس صرفي مرتفع. كما أن ميل منحنى Zipf (الكلمات النحوية المستقلة ≈ -0.95؛ اللواحق ≈ -1.08) يتوافق مع الملف المتوقع للتوزيع اللغوي.
تُظهر النتائج أن الحدود بين الكلمات الكاملة والكلمات النحوية تتحرك وفق ثلاثة مسارات مميزة في التركية. أولاً، الانتقال من الكلمة الكاملة إلى الكلمة النحوية. التحول من الفعل الكامل durur إلى اللاحقة المختصرة -dır هو مثال مباشر على سلسلة "كلمة معجمية > كلمة نحوية > أداة ربط > لاحقة صرفية" التي وضعها Hopper و Traugott (2003). نص دده قورقوت يحتفظ بكلا الطرفين في حضور متزامن، مما يقدّم صورة مجمّدة لعملية التآكل الصوتي. ثانياً، الاستبدال الشكلي بين الفئات النحوية. فاللاحقة -arak تحل محل -uban، و -dığım تحل محل -dügüm، و -ayım تحل محل -ayum. الوظيفة النحوية تبقى، لكن الشكل يتغير. ثالثاً، اندثار الكلمات النحوية المستقلة. mere، dahı، karşu، meger، و içün تختفي تماماً من اللغة الحديثة. هذا يوضح أن الفئة النحوية يمكن أن تتجدد في الوظيفة كما في الشكل. كما أن الطابع الإلصاقي للتركية يتطلب أن يمتد التحليل إلى ما دون مستوى الكلمة. فالتحليل على مستوى الكلمة يقلل من تمثيل الحمل النحوي في التركية. أما التوسيع إلى مستوى المورفيم فيُظهر أن الحمل قابل للمقارنة مع اللغات التحليلية مثل الإنجليزية. النمط الصرفي لا يحدد حجم هذا الحمل بل موقعه. في النهاية، نص دده قورقوت هو صورة حيّة لتحوّل الكلمات النحوية عبر 500 عام من التركية. المنهج المطوّر هنا هو نموذج قابل للتطبيق على نصوص تاريخية أخرى مثل ديوان لغات الترك، كتاب قوتادغو بيليك، وديوان يونس إمره. وهو بذلك يمهّد لرسم خريطة التطور الصرفي للتركية عبر ألف عام.
الكلمات المفتاحية: دده قورقوت، التعابير النحوية، التحليل الصرفي، التَصريف النحوي، التركية الأناضولية القديمة، علم اللغة التاريخي، هوبر-تروغوت، علم اللغة المعجمي، الطابع الإلصاقي، لاحقة الربط -dır.
Résumé Structuré:
La distinction entre termes catégorématiques et syncatégorématiques, héritée de la logique scolastique médiévale, divise les mots en deux classes selon qu’ils portent un sens par eux-mêmes. Les termes catégorématiques (noms, adjectifs, verbes) sont des unités sémantiques indépendantes et peuvent fonctionner comme sujets ou prédicats. Les termes syncatégorématiques (postpositions, conjonctions, suffixes flexionnels) n’acquièrent de sens qu’en combinaison avec d’autres termes. Cette distinction remonte à la notion de prossēmainein chez Aristote dans De Interpretatione, s’est transmise par Boèce en latin, et a été systématisée dans les manuels de Guillaume de Sherwood et de Pedro Hispano (Kretzmann, 1982 ; Klima, 2006). La sémantique formelle moderne, la philosophie du langage et la linguistique ont hérité de ce partage, qui demeure aujourd’hui en arrière-plan des débats sur les constantes logiques (MacFarlane, 2015) et des travaux linguistiques sur les mots fonctionnels et les morphèmes liés.
Cependant, l’application de cette distinction varie fortement selon les profils typologiques. Dans les langues analytiques comme le latin et l’anglais, la fonction syncatégorématique est principalement portée par des mots indépendants. Dans les langues agglutinantes comme le turc, une grande partie de ce travail est accomplie par des morphèmes liés au radical. Les suffixes de cas, de temps, de possession, de modalité, de participe et de gérondif n’ont pas de sens isolé. Avec leur radical hôte, ils codent le rôle relationnel du mot dans la phrase. Cette caractéristique typologique impose d’examiner le profil syncatégorématique des textes turcs au niveau du morphème, et non seulement au niveau du mot.
Les récits de Dede Korkut constituent une collection canonique de récits oghuz qui documentent la transition du turc anatolien ancien vers le turc ottoman, à la rencontre de la tradition orale et de la culture écrite (Ergin, 1989 ; Gökyay, 2000 ; Tezcan, 2001). Un troisième manuscrit, aux côtés des copies connues de Dresde et du Vatican, a été présenté à la communauté scientifique par le Professeur Metin Ekici lors du symposium de Bayburt (25-27 avril 2019). Ce manuscrit de 31 feuillets, provenant de la région de Gonbad-e Kāvus dans la province iranienne de Golestan, est daté du XVIIIe siècle sur des bases linguistiques (Ekici, 2019). La plupart des études sur Dede Korkut se concentrent sur des questions littéraires, thématiques ou historico-culturelles. Le profil morphologique, et en particulier la distribution quantitative des morphèmes syncatégorématiques, n’a pas encore été étudié en détail. L’objectif principal de cette étude est de fournir un tel inventaire morphémique à partir de l’édition critique d’Özçelik (2016) du manuscrit de Dresde. L’objectif secondaire est de comparer les données du XVIe siècle avec une version turque moderne et de déterminer quantitativement quelles formes sont devenues non fonctionnelles, lesquelles ont augmenté et lesquelles sont restées stables sur un intervalle de 500 ans. Ce second objectif transforme l’étude en une lecture de grammaticalisation plutôt qu’en un inventaire étroitement conçu.
Le corpus principal est le deuxième volume de l’édition d’Özçelik (2016), Manuscrit de Dresde : Texte, Index, publié par la Société de la langue turque. Les 279 pages numérotées paires (pp. 42-598) ont été traitées. Chaque page a été convertie en JPEG à 200 dpi via pdftoppm, puis soumise à tesseract-ocr (version 5.3.4) avec le modèle linguistique turc. Les notes, en-têtes, marques foliaires et lignes non numérotées ont été filtrées automatiquement ; seules les lignes principales numérotées ont été retenues. La procédure a produit un corpus de 26 254 mots tirés de 240 feuillets. Les caractères philologiques spéciaux ont été réduits à des lettres latines standard. Le taux d’erreur OCR a été estimé à environ 2-4 % par échantillonnage manuel. Pour la comparaison diachronique, une version numérique moderne (2009) couvrant huit récits et 22 862 mots a servi de corpus secondaire.
Un décomposeur morphémique basé sur regex en sept couches a été développé spécifiquement pour la recherche. Il applique un dépouillement de droite à gauche selon le principe du plus long appariement, avec une longueur minimale de radical de deux phonèmes. Les couches sont : suffixes privatifs/dérivationnels, suffixe pluriel, suffixes possessifs, suffixes casuels, suffixes participiaux et gérondiaux, suffixes de temps et de modalité, suffixes de personne/interrogatif/copule. Les formes archaïques oghuz ont également été ajoutées : -uban/-üben (gérondif), -ubanı, -gıl/-gil (impératif 2sg), -dügüm, -dukda, -durur/-dur, -iser/-ısar, -ayum/-eyüm, -madın/-medin. Les mots syncatégorématiques indépendants ont été classés en huit catégories : conjonctions, quantificateurs, mots de négation et d’inexistence, déterminants, postpositions, particules interrogatives, marqueurs de modalité/impératif/optatif, et interjections/formules d’adresse. Cette classification étend le classement morphologique proposé par Korkmaz (2014) pour le turc moderne afin d’inclure des formes spécifiques au turc oghuz. L’évaluation statistique repose sur des taux normalisés par 1 000 mots, des tests du chi carré d’indépendance et une analyse de pente de Zipf.
Le corpus du XVIe siècle contient 2 824 mots syncatégorématiques indépendants et 25 020 morphèmes liés. La charge syncatégorématique combinée est de 27 844 unités et la densité par mot est de 1,06. Les valeurs de densité par récit se regroupent dans une bande étroite entre 1,00 et 1,15 ; cette constance soutient indirectement l’hypothèse d’un seul scribe. Parmi les morphèmes liés, les suffixes casuels représentent 43,8 % de la charge totale, les suffixes temporels 22,0 %, et les suffixes participiaux 11,3 %. Le morphème lié le plus fréquent est l’accusatif -i (3 691 occurrences, 140,6 pour 1 000 mots), suivi du passé attesté -dı/-di (3 546, 135,1) et du datif -a/-e (3 468, 132,1). La forme génitive/possessive oghuz -ün apparaît 2 320 fois en quatrième position et marque une trace dialectale oghuz qui n’a pas évolué vers le -in du turc moderne. Les mots syncatégorématiques indépendants les plus fréquents sont : bir (281), ne (196), ve (145), bu (139), göre (127), mere (124), ol (118) et dahı (114).
La comparaison diachronique met en évidence trois trajectoires distinctes de changement. Premièrement, les suffixes archaïques sont devenus largement non fonctionnels : le gérondif -uban passe de 60 à 0, l’impératif -gıl/-gil de 226 à 19, le participe + possessif -dügüm de 59 à 12, et la copule -durur de 762 à 80. Deuxièmement, les formes modernes augmentent fortement : la copule enclitique -dır passe de 258 à 486, plus que doublant ; l’optatif -ayım/-alım passe de 3 à 134 ; le gérondif -madan de 2 à 41 ; la combinaison passé rapporté + narratif -mıştı de 0 à 65 ; et le gérondif moderne -arak de 9 à 51. Troisièmement, plusieurs mots syncatégorématiques indépendants deviennent entièrement archaïques : mere (124 > 0), dahı (114 > 0), karşu (51 > 0), meger (36 > 0), içün (28 > 0) disparaissent de la version moderne ; le démonstratif distal ol chute de 118 à 5. En termes statistiques, le test du chi carré retourne p < 0,001 pour les catégories cas, temps et participe. Les valeurs de densité par récit présentent un écart-type σ = 0,042, indiquant une homogénéité morphologique élevée. Les pentes de Zipf (≈ -0,95 pour les syncatégorématiques indépendants ; ≈ -1,08 pour les suffixes) correspondent au profil linguistique attendu.
Les résultats montrent que la frontière catégorématique-syncatégorématique évolue selon trois trajectoires distinct La comparaison diachronique met en évidence trois schémas distincts de changement. Premièrement, les suffixes archaïques sont devenus largement non fonctionnels. Le gérondif -uban passe de 60 à 0, l’impératif -gıl/-gil de 226 à 19, le participe + possessif -dügüm de 59 à 12, et la copule -durur de 762 à 80. Deuxièmement, les formes modernes augmentent fortement. La copule clitique -dır passe de 258 à 486, soit plus du double. L’optatif -ayım/-alım passe de 3 à 134, le gérondif -madan de 2 à 41, la combinaison passé rapporté + narratif -mıştı de 0 à 65, et le gérondif moderne -arak de 9 à 51. Troisièmement, plusieurs mots syncatégorématiques indépendants deviennent entièrement archaïques. mere (124 > 0), dahı (114 > 0), karşu (51 > 0), meger (36 > 0), et içün (28 > 0) disparaissent de la version moderne ; le démonstratif distal ol chute de 118 à 5. Sur le plan statistique, le test du chi carré donne p < 0.001 pour les catégories cas, temps et participe. Les valeurs de densité basées sur le récit présentent un écart-type de σ = 0.042, indiquant une homogénéité morphologique élevée. Les pentes de Zipf (syncatégorématiques indépendants ≈ -0.95 ; suffixes ≈ -1.08) correspondent au profil attendu de distribution linguistique.
Les résultats montrent que la frontière entre catégorématiques et syncatégorématiques évolue selon trois trajectoires distinctes en turc. Premièrement, la transition du catégorématique vers le syncatégorématique. Le passage du verbe plein durur au suffixe abrégé -dır est un exemple direct de la chaîne « mot lexical > mot grammatical > clitique > affixe flexionnel » définie par Hopper et Traugott (2003). Le texte de Dede Korkut conserve les deux extrémités de cette chaîne en co-présence synchronique, offrant ainsi une photographie figée du processus d’érosion phonologique. Deuxièmement, le remplacement formel au sein des catégories syncatégorématiques. -arak remplace -uban, -dığım remplace -dügüm, -ayım remplace -ayum. La fonction grammaticale persiste ; seul le signe change. Troisièmement, l’archaïsation totale des mots syncatégorématiques. mere, dahı, karşu, meger et içün disparaissent complètement de la langue moderne. Cela montre que la classe syncatégorématique peut se renouveler tant dans la fonction que dans la forme. La typologie agglutinante du turc exige en outre que l’analyse descende au-dessous du niveau du mot. Une analyse au niveau du mot sous-représente la charge syncatégorématique du turc. L’extension au niveau du morphème documente que cette charge est comparable à celle des langues analytiques telles que l’anglais. La typologie détermine non pas la taille de cette charge mais l’endroit où elle est portée. En définitive, le texte de Dede Korkut est une photographie vivante de la transformation syncatégorématique sur 500 ans de turc. La méthode développée ici constitue un modèle applicable à d’autres textes historiques tels que le Divânü Lügâti’t-Türk, le Kutadgu Bilig et le Divan de Yunus Emre. Elle jette ainsi les bases de la cartographie du développement morphologique millénaire du turc.
Mots-Clés: Dede Korkut, expressions syncatégorématiques, analyse morphologique, grammaticalisation, turc anatolien ancien, linguistique historique, Hopper-Traugott, linguistique de corpus, typologie agglutinante, suffixe copule -dır.
Resumen Estructurado:
La distinción entre términos categoremáticos y sincategoremáticos, heredada de la lógica escolástica medieval, divide las palabras en dos clases según si portan significado por sí mismas. Los términos categoremáticos (sustantivos, adjetivos, verbos) son unidades semánticas independientes y pueden funcionar como sujetos o predicados. Los términos sincategoremáticos (posposiciones, conjunciones, sufijos flexionales) adquieren significado únicamente en combinación con otros términos. Esta distinción se remonta a la noción de prossēmainein en Aristóteles (De Interpretatione), se transmitió a través de Boecio en latín y fue sistematizada en los manuales de Guillermo de Sherwood y Pedro Hispano (Kretzmann, 1982; Klima, 2006). La semántica formal moderna, la filosofía del lenguaje y la lingüística heredaron esta partición, que hoy se encuentra en el trasfondo teórico de los debates sobre las constantes lógicas (MacFarlane, 2015) y de los estudios lingüísticos sobre palabras funcionales y morfemas ligados.
Sin embargo, la aplicación de esta distinción varía notablemente según los perfiles tipológicos. En lenguas analíticas como el latín y el inglés, la función sincategoremática recae principalmente en palabras independientes. En lenguas aglutinantes como el turco, gran parte de este trabajo lo realizan morfemas ligados al radical. Los sufijos de caso, tiempo, posesión, modalidad, participio y gerundio no tienen significado por sí solos. Junto con su raíz anfitriona, codifican el papel relacional de la palabra en la cláusula. Esta característica tipológica exige examinar el perfil sincategoremático de los textos turcos a nivel de morfema, no solo a nivel de palabra.
Las historias de Dede Korkut constituyen una colección canónica de narraciones oghuz que documentan la transición del turco anatolio antiguo al turco otomano, en el punto de encuentro entre tradición oral y cultura escrita (Ergin, 1989; Gökyay, 2000; Tezcan, 2001). Un tercer manuscrito, junto a las copias conocidas de Dresde y del Vaticano, fue presentado a la comunidad académica por el Prof. Dr. Metin Ekici en el simposio celebrado en Bayburt (25-27 de abril de 2019). El manuscrito de 31 folios, originario de la región de Gonbad-e Kāvus en la provincia iraní de Golestán, se fecha en el siglo XVIII sobre bases lingüísticas (Ekici, 2019). La mayoría de los estudios sobre Dede Korkut se concentran en cuestiones literarias, temáticas o histórico-culturales. El perfil morfológico, y específicamente la distribución cuantitativa de los morfemas sincategoremáticos, aún no ha sido examinado en detalle. El objetivo principal de este estudio es proporcionar dicho inventario morfémico a partir de la edición crítica de Özçelik (2016) del manuscrito de Dresde. El objetivo secundario es comparar los datos del siglo XVI con una versión moderna del turco y determinar cuantitativamente qué formas han dejado de ser funcionales, cuáles han aumentado y cuáles se han mantenido estables a lo largo de 500 años. Este segundo objetivo convierte el estudio en una lectura de gramaticalización más que en un inventario estrictamente concebido.
El corpus principal es el segundo volumen de la edición de Özçelik (2016), Manuscrito de Dresde: Texto, Índice, publicado por la Sociedad de la Lengua Turca. Se procesaron las 279 páginas numeradas pares (pp. 42-598). Cada página se convirtió en JPEG a 200 dpi mediante pdftoppm y luego se pasó por tesseract-ocr (versión 5.3.4) con el modelo de lengua turca. Se filtraron automáticamente notas, encabezados, marcas de folio y líneas no numeradas; solo se conservaron las líneas principales numeradas. El procedimiento produjo un corpus de 26.254 palabras extraídas de 240 folios. Los caracteres filológicos especiales se redujeron a letras latinas estándar. La tasa de error OCR se estimó en aproximadamente 2-4 % mediante muestreo manual. Para la comparación diacrónica, se utilizó como corpus secundario una versión digital moderna de 2009 que cubre ocho relatos y 22.862 palabras.
Se desarrolló un despojador morfémico basado en expresiones regulares de siete capas específicamente para la investigación. Aplica un despojo de derecha a izquierda bajo el principio de coincidencia más larga, con una longitud mínima de raíz de dos fonemas. Las capas son: sufijos privativos/derivativos, sufijo plural, sufijos posesivos, sufijos de caso, sufijos participiales y gerundiales, sufijos de tiempo y modalidad, y sufijos de persona/interrogativo/copulativos. También se añadieron formas arcaicas oghuz: -uban/-üben (gerundio), -ubanı, -gıl/-gil (imperativo 2sg), -dügüm, -dukda, -durur/-dur, -iser/-ısar, -ayum/-eyüm, -madın/-medin. Las palabras sincategoremáticas independientes se clasificaron en ocho categorías: conjunciones, cuantificadores, palabras de negación y inexistencia, determinantes, posposiciones, partículas interrogativas, marcadores de modalidad/imperativo/optativo, e interjecciones/formas de tratamiento. La clasificación amplía la jerarquía morfológica que Korkmaz (2014) propone para el turco moderno a fin de incluir formas específicas del turco oghuz. La evaluación estadística se basa en tasas normalizadas por cada 1.000 palabras, pruebas de independencia chi-cuadrado y análisis de pendiente de Zipf.
El corpus del siglo XVI contiene 2.824 palabras sincategoremáticas independientes y 25.020 morfemas ligados. La carga sincategoremática combinada es de 27.844 unidades y la densidad por palabra es de 1,06. Los valores de densidad por relato se agrupan en una banda estrecha entre 1,00 y 1,15; esta consistencia respalda indirectamente la hipótesis de un único escriba. Entre los morfemas ligados, los sufijos de caso representan el 43,8 % de la carga total, los sufijos de tiempo el 22,0 % y los sufijos participiales el 11,3 %. El morfema ligado más frecuente es el acusativo -i (3.691 casos, 140,6 por 1.000 palabras), seguido del pasado evidencial -dı/-di (3.546, 135,1) y el dativo -a/-e (3.468, 132,1). La forma genitiva/posesiva oghuz -ün aparece 2.320 veces en cuarto lugar y marca un rasgo dialectal oghuz que no evolucionó hacia el -in del turco moderno. Las palabras sincategoremáticas independientes más frecuentes son: bir (281), ne (196), ve (145), bu (139), göre (127), mere (124), ol (118) y dahı (114).
La comparación diacrónica revela tres patrones distintos de cambio. Primero, los sufijos arcaicos han dejado de ser funcionales: el gerundio -uban cae de 60 a 0, el imperativo -gıl/-gil de 226 a 19, el participio + posesivo -dügüm de 59 a 12, y la cópula -durur de 762 a 80. Segundo, las formas modernas aumentan notablemente: la cópula clítica -dır pasa de 258 a 486, más que duplicándose; el optativo -ayım/-alım sube de 3 a 134; el gerundio -madan de 2 a 41; la combinación pasado reportado + narrativo -mıştı de 0 a 65; y el gerundio moderno -arak de 9 a 51. Tercero, varias palabras sincategoremáticas independientes se vuelven completamente arcaicas: mere (124 > 0), dahı (114 > 0), karşu (51 > 0), meger (36 > 0), içün (28 > 0) desaparecen de la versión moderna; el demostrativo distal ol desciende de 118 a 5. En términos estadísticos, la prueba chi-cuadrado devuelve p < 0,001 para las categorías de caso, tiempo y participio. Los valores de densidad por relato tienen una desviación estándar de σ = 0,042, lo que indica una alta homogeneidad morfológica. Las pendientes de Zipf (≈ -0,95 para sincategoremáticos independientes; ≈ -1,08 para sufijos) coinciden con el perfil lingüístico esperado.
Los hallazgos muestran que la frontera categoremático-sincategoremático se desplaza según tres trayectorias distintas en turco. Primero, la transición de categoremático a sincategoremático: el paso del verbo pleno durur al sufijo abreviado -dır es un ejemplo directo del continuo “palabra La comparación diacrónica revela tres patrones distintos de cambio. En primer lugar, los sufijos arcaicos han perdido en gran medida su funcionalidad. El gerundio -uban cae de 60 a 0, el imperativo -gıl/-gil de 226 a 19, el participio + posesivo -dügüm de 59 a 12, y la cópula -durur de 762 a 80. En segundo lugar, las formas modernas aumentan de manera pronunciada. La cópula clítica -dır pasa de 258 a 486, más que duplicándose. El optativo -ayım/-alım sube de 3 a 134, el gerundio -madan de 2 a 41, la combinación pasado reportado + narrativo -mıştı de 0 a 65, y el gerundio moderno -arak de 9 a 51. En tercer lugar, varias palabras syncategoremáticas independientes se vuelven completamente arcaicas. mere (124 > 0), dahı (114 > 0), karşu (51 > 0), meger (36 > 0), e içün (28 > 0) desaparecen de la versión moderna; el demostrativo distal ol desciende de 118 a 5. En términos estadísticos, la prueba chi-cuadrado arroja p < 0.001 para las categorías de caso, tiempo y participio. Los valores de densidad basados en la narración presentan una desviación estándar de σ = 0.042, lo que indica una alta homogeneidad morfológica. Las pendientes de Zipf (syncategoremáticos independientes ≈ -0.95; sufijos ≈ -1.08) coinciden con el perfil esperado de distribución lingüística.
Los hallazgos muestran que la frontera entre categoremáticos y syncategoremáticos se desplaza a lo largo de tres trayectorias distintas en turco. Primero, la transición de categoremático a syncategoremático. El cambio del verbo pleno durur al sufijo abreviado -dır es un ejemplo directo de la cadena «palabra léxica > palabra gramatical > clítico > afijo flexional» establecida por Hopper y Traugott (2003). El texto de Dede Korkut conserva ambos extremos de esta cadena en co-presencia sincrónica, ofreciendo así una fotografía congelada del proceso de erosión fonológica. Segundo, el reemplazo formal entre categorías syncategoremáticas. -arak sustituye a -uban, -dığım a -dügüm, -ayım a -ayum. La función gramatical persiste; solo cambia la forma. Tercero, la arcaización total de las palabras syncategoremáticas. mere, dahı, karşu, meger e içün desaparecen por completo de la lengua moderna. Esto demuestra que la clase syncategoremática puede renovarse tanto en función como en forma. La tipología aglutinante del turco exige además que el análisis se extienda por debajo del nivel de la palabra. Un análisis a nivel de palabra subrepresenta la carga syncategoremática del turco. La extensión al nivel del morfema documenta que dicha carga es comparable a la de lenguas analíticas como el inglés. La tipología determina no el tamaño de esta carga, sino dónde se lleva. En definitiva, el texto de Dede Korkut es una fotografía viva de la transformación syncategoremática a lo largo de 500 años de turco. El método desarrollado aquí constituye un modelo aplicable a otros textos históricos como el Divânü Lügâti’t-Türk, el Kutadgu Bilig y el Diván de Yunus Emre. De este modo, sienta las bases para trazar el desarrollo morfológico milenario del turco.
Palabras Clave: Dede Korkut, expresiones syncategoremáticas, análisis morfológico, gramaticalización, turco anatolio antiguo, lingüística histórica, Hopper-Traugott, lingüística de corpus, tipología aglutinante, sufijo copulativo -dır.
结构化摘要:
中世纪经院逻辑继承的范畴词(categorematic)与非范畴词(syncategorematic)的区分,将词语分为两类:是否能独立承载意义。范畴词(名词、形容词、动词)是独立的语义单位,可以充当主语或谓语;非范畴词(后置词、连词、屈折词缀)只有在与其他词结合时才获得意义。这一区分可追溯至亚里士多德《解释篇》中的 prossēmainein 概念,经由波伊提乌斯的拉丁文传递,并在威廉·舍伍德和佩德罗·伊斯帕诺的逻辑手册中得到系统化(Kretzmann, 1982;Klima, 2006)。现代形式语义学、语言哲学和语言学继承了这一划分,它至今仍是逻辑常项(MacFarlane, 2015)以及功能词和黏着语素研究的理论背景。
然而,这一区分的应用在不同类型学的语言中差异显著。在拉丁语和英语等分析型语言中,非范畴功能主要由独立词承担;而在土耳其语等黏着型语言中,大部分功能由附着在词根上的黏着语素完成。格、时态、所有格、情态、分词和动名词的词缀本身没有独立意义,它们与词根结合后才编码词在句子中的关系角色。这一类型学特征要求在研究土耳其语文本时,不仅要在词层面,更要在语素层面对非范畴词进行考察。
《德德·科尔库特故事》是奥古兹叙事的经典集成,记录了古安纳托利亚土耳其语向奥斯曼土耳其语的过渡,处于口头传统与书面文化的交汇点(Ergin, 1989;Gökyay, 2000;Tezcan, 2001)。除德累斯顿和梵蒂冈抄本外,2019年4月25-27日在巴伊布尔特举行的研讨会上,艾基奇教授公布了第三份手稿。该手稿共31叶,来自伊朗戈勒斯坦省 Gonbad-e Kāvus 地区,依据语言学特征定年为18世纪(Ekici, 2019)。以往研究多集中于文学、主题或文化史问题,而形态学特征,尤其是非范畴语素的数量分布,尚未得到详细探讨。本研究的主要目标是基于Özçelik(2016)对德累斯顿抄本的校勘版,提供语素层面的清单;次要目标是将16世纪数据与现代土耳其语译本进行比较,定量分析哪些形式已不再使用,哪些形式增加,哪些形式保持稳定,从而将研究转化为语法化的解读。
主要语料为Özçelik(2016)出版的《德累斯顿抄本:文本与索引》第二卷,共处理279页(第42-598页)。每页经 pdftoppm 转换为200 dpi JPEG,再用 tesseract-ocr(5.3.4版,土耳其语模型)识别。脚注、页眉、叶次标记和未编号行均自动过滤,仅保留正文编号行。最终得到26,254词,来自240叶。特殊字符统一为标准拉丁字母。人工抽样估计OCR错误率约为2-4%。对比语料为2009年出版的现代土耳其语数字译本,涵盖八个故事,共22,862词。
研究开发了七层正则表达式语素剥离器,按最长匹配原则自右向左剥离,词根最少两音位。七层依次为:派生/否定词缀、复数词缀、所有格词缀、格词缀、分词与动名词词缀、时态与情态词缀、人称/疑问/系词词缀。并加入奥古兹土耳其语古形式:-uban/-üben(动名词)、-ubanı、-gıl/-gil(第二人称单数祈使)、-dügüm、-dukda、-durur/-dur、-iser/-ısar、-ayum/-eyüm、-madın/-medin。独立的非范畴词分为八类:连词、量词、否定与不存在词、限定词、后置词、疑问词、情态/祈使/愿望标记、感叹词/称呼语。该分类在Korkmaz(2014)对现代土耳其语的形态学排序基础上扩展,以涵盖奥古兹土耳其语特有形式。统计分析采用每千词标准化率、卡方独立性检验和Zipf斜率分析。
16世纪语料包含2,824个独立非范畴词和25,020个黏着语素。总负荷为27,844单位,每词密度为1.06。故事层面的密度值集中在1.00至1.15之间,间接支持单一抄写者假设。在黏着语素中,格词缀占43.8%,时态词缀占22.0%,分词词缀占11.3%。最常见的黏着语素是宾格 -i(3,691次,每千词140.6),其次是见证过去时 -dı/-di(3,546次,135.1),与与格 -a/-e(3,468次,132.1)。奥古兹土耳其语的属格/所有格形式 -ün 出现2,320次,位居第四,显示出未演变为现代土耳其语 -in 的方言痕迹。最常见的独立非范畴词为:bir (281)、ne (196)、ve (145)、bu (139)、göre (127)、mere (124)、ol (118)、dahı (114)。
历时比较揭示了三种变化模式。第一,古老词缀基本失去功能:动名词 -uban 从60降至0,祈使 -gıl/-gil 从226降至19,分词+所有格 -dügüm 从59降至12,系词 -durur 从762降至80。第二,现代形式显著上升:系词 -dır 从258增至486,愿望式 -ayım/-alım 从3增至134,动名词 -madan 从2增至41,叙事过去时组合 -mıştı 从0增至65,现代动名词 -arak 从9增至51。第三,若干独立非范畴词完全古化:mere (124 > 0)、dahı (114 > 0)、karşu (51 > 0)、meger (36 > 0)、içün (28 > 0) 在现代译本中消失;远指示代词 ol 从118降至5。统计上,卡方检验在格、时态和分词类别中返回 p < 0.001。故事密度值的标准差 σ = 0.042,显示高度形态一致性。Zipf斜率(独立非范畴 ≈ -0.95;词缀 ≈ -1.08)符合预期的语言分布特征。
研究结果表明,土耳其语中范畴词与非范畴词的边界沿三条不同轨迹移动。第一,从范畴到非范畴的转化:动词 durur 向缩短的系词 -dır 的转变,是Hopper与Traugott(2003)提出的“实词 > 虚词 > 附着词 > 屈折词缀”连续体的直接实例。《德德·科尔库特故事》同时保留了这一连续体的两端,提供了语音侵蚀过程的静态图像。第二,非范畴类别之间的形式替换:-arak 取代 -uban,-dığım 取代 -dügüm,-ayım 取代 -ayum。语法功能保持不变,仅形式发生变化。第三,独立非范畴词的整体古化:mere、dahı、karşu、meger、içün 完全退出现代语言。这表明非范畴类不仅能在形式上更新,也能在功能上更新。土耳其语的黏着类型学进一步要求分析深入到语素层面。仅在词层面的分析会低 历时比较揭示了三种不同的变化模式。首先,古老的词缀在很大程度上失去了功能。动名词 -uban 从 60 降至 0,祈使词缀 -gıl/-gil 从 226 降至 19,分词 + 所有格 -dügüm 从 59 降至 12,系词 -durur 从 762 降至 80。其次,现代形式显著上升。系词附着词 -dır 从 258 增至 486,增长一倍以上。愿望式 -ayım/-alım 从 3 增至 134,动名词 -madan 从 2 增至 41,传闻过去时 + 叙事组合 -mıştı 从 0 增至 65,现代动名词 -arak 从 9 增至 51。第三,若干独立的次范畴词完全古化。mere (124 > 0)、dahı (114 > 0)、karşu (51 > 0)、meger (36 > 0)、以及 içün (28 > 0) 在现代版本中消失;远指示代词 ol 从 118 降至 5。从统计学角度看,卡方检验在格、时态和分词类别中返回 p < 0.001。基于故事的密度值标准差为 σ = 0.042,显示出高度的形态一致性。Zipf 斜率(独立次范畴词 ≈ -0.95;词缀 ≈ -1.08)符合预期的语言分布特征。
研究结果表明,在土耳其语中,范畴词与次范畴词的边界沿着三条不同的轨迹移动。第一,范畴词向次范畴词的转变。从完整动词 durur 到缩略词缀 -dır 的转变,是 Hopper 与 Traugott (2003) 所提出的“实词 > 虚词 > 附着词 > 屈折词缀”链条的直接实例。《德德·科尔库特》文本在共时并存中保留了这一链条的两端,从而提供了语音侵蚀过程的静态图像。第二,次范畴类别之间的形式替换。-arak 取代 -uban,-dığım 取代 -dügüm,-ayım 取代 -ayum。语法功能保持不变,仅形式发生变化。第三,次范畴词的整体古化。mere、dahı、karşu、meger 和 içün 在现代语言中完全消失。这表明次范畴类不仅能在形式上更新,也能在功能上更新。土耳其语的黏着型特征进一步要求分析深入到词以下的层面。词级分析低估了土耳其语的次范畴负荷。形态素层面的扩展表明,这一负荷与英语等分析型语言相当。类型学决定的不是负荷的大小,而是负荷的承载位置。最终,《德德·科尔库特》文本是土耳其语 500 年次范畴转变的生动图像。此处发展的方法是一个可应用于其他历史文本的范式,如《突厥语大词典》、《福乐智慧》以及尤努斯·埃姆雷的诗集。它为绘制土耳其语千年形态发展的地图奠定了基础。
关键词: 德德·科尔库特(Dede Korkut)、非范畴表达(syncategorematic expressions)、形态学分析、语法化(grammaticalisation)、古安纳托利亚土耳其语、历史语言学、Hopper-Traugott、语料库语言学、黏着语类型学、-dır 系词词缀。
Структурированный Pеферат:
Различие между категорматическими и синкатегорматическими терминами, унаследованное от средневековой схоластической логики, делит слова на два класса в зависимости от того, несут ли они значение самостоятельно. Категорматические термины (существительные, прилагательные, глаголы) являются независимыми семантическими единицами и могут функционировать как подлежащие или сказуемые. Синкатегорматические термины (послелоги, союзы, флективные суффиксы) приобретают значение только в сочетании с другими терминами. Это различие восходит к понятию prossēmainein в трактате Аристотеля Об истолковании, было передано через Боэция на латинский язык и систематизировано в руководствах Вильгельма Шервудского и Педро Испано (Kretzmann, 1982; Klima, 2006). Современная формальная семантика, философия языка и лингвистика унаследовали это деление, которое сегодня лежит в теоретической основе дискуссий о логических константах (MacFarlane, 2015) и исследований функциональных слов и связанных морфем.
Однако применение этого различия резко варьируется в зависимости от типологического профиля языка. В аналитических языках, таких как латинский и английский, синкатегорматическая функция в основном реализуется независимыми словами. В агглютинативных языках, таких как турецкий, значительная часть этой работы выполняется связанными морфемами, прикреплёнными к корню. Суффиксы падежа, времени, принадлежности, модальности, причастия и деепричастия не имеют самостоятельного значения. Вместе с корнем они кодируют реляционную роль слова в предложении. Эта типологическая особенность требует анализа синкатегорматического профиля турецких текстов на уровне морфем, а не только на уровне слов.
Рассказы Деде Коркута представляют собой каноническое собрание огузских повествований, фиксирующих переход от древнеанатолийского турецкого языка к османскому турецкому на стыке устной традиции и письменной культуры (Ergin, 1989; Gökyay, 2000; Tezcan, 2001). Третий манускрипт, наряду с давно известными дрезденской и ватиканской копиями, был представлен научному сообществу профессором Метином Экиджи на симпозиуме в Байбурте 25–27 апреля 2019 года. Рукопись объёмом 31 фолио, происходящая из региона Гонбад-е Кавус в иранской провинции Голестан, датируется XVIII веком на основании лингвистических признаков (Ekici, 2019). Большинство исследований Деде Коркута сосредоточено на литературных, тематических или культурно-исторических вопросах. Морфологический профиль, и в частности количественное распределение синкатегорматических морфем, ещё не был подробно изучен. Основная цель данного исследования — предоставить такой морфемный инвентарь на основе критического издания Озчелика (2016) дрезденской рукописи. Вторичная цель — сравнить данные XVI века с современным турецким переводом и количественно определить, какие формы утратили функциональность, какие возросли, а какие остались стабильными за 500-летний период. Эта вторая цель превращает исследование в чтение процесса грамматикализации, а не в узко понятый инвентарь.
Основной корпус — второй том издания Озчелика (2016) Дрезденская рукопись: текст, индекс, опубликованный Обществом турецкого языка. Обработаны 279 чётных страниц латинской транскрипции (с. 42–598). Каждая страница была преобразована в JPEG с разрешением 200 dpi с помощью pdftoppm, затем распознана через tesseract-ocr (версия 5.3.4) с турецкой языковой моделью. Сноски, колонтитулы, фолио-маркеры и ненумерованные строки были автоматически отфильтрованы; сохранены только пронумерованные строки основного текста. В результате получен корпус из 26 254 слов, извлечённых из 240 фолио. Филологические специальные символы были сведены к стандартным латинским буквам. Ошибка OCR оценена примерно в 2–4 % по ручной выборке. Для диахронного сравнения использован цифровой современный турецкий перевод 2009 года, охватывающий восемь рассказов и 22 862 слова.
Был разработан семислойный морфемный стриппер на основе регулярных выражений. Он применяет удаление справа налево по принципу наибольшего совпадения, с минимальной длиной корня в два фонема. Слои: деривационные/приватные суффиксы, суффикс множественного числа, суффиксы принадлежности, падежные суффиксы, причастные и деепричастные суффиксы, суффиксы времени и модальности, суффиксы лица/вопросительные/копулятивные. Добавлены также архаические огузские формы: -uban/-üben (деепричастие), -ubanı, -gıl/-gil (2 л. ед. ч. повелительное), -dügüm, -dukda, -durur/-dur, -iser/-ısar, -ayum/-eyüm, -madın/-medin. Независимые синкатегорматические слова классифицированы в восемь категорий: союзы, квантификаторы, слова отрицания и отсутствия, детерминативы, послелоги, вопросительные частицы, маркеры модальности/императива/оптатива, междометия/формы обращения. Классификация расширяет морфологическую иерархию, предложенную Коркмазом (2014) для современного турецкого, чтобы включить формы, специфические для огузского турецкого. Статистическая оценка основана на нормированных показателях на 1 000 слов, тестах хи-квадрат независимости и анализе наклона по Ципфу.
Корпус XVI века содержит 2 824 независимых синкатегорматических слова и 25 020 связанных морфем. Общая нагрузка составляет 27 844 единицы, плотность на слово — 1,06. Значения плотности на уровне рассказа группируются в узком диапазоне между 1,00 и 1,15; эта согласованность косвенно подтверждает гипотезу об одном писце. Среди связанных морфем падежные суффиксы составляют 43,8 % общей нагрузки, временные суффиксы — 22,0 %, причастные — 11,3 %. Наиболее частотный морфем — винительный -i (3 691 случаев, 140,6 на 1 000 слов), за ним следует прошедшее время свидетельствованное -dı/-di (3 546, 135,1) и дательный -a/-e (3 468, 132,1). Огузская форма родительного/притяжательного -ün встречается 2 320 раз и занимает четвёртое место, фиксируя диалектный след, не перешедший в современный турецкий -in. Наиболее частотные независимые синкатегорматические слова: bir (281), ne (196), ve (145), bu (139), göre (127), mere (124), ol (118), dahı (114).
Диахронное сравнение выявляет три различных паттерна изменений. Во-первых, архаические суффиксы в значительной степени утратили функциональность: деепричастие -uban падает с 60 до 0, императив -gıl/-gil с 226 до 19, причастие + притяжательное -dügüm с 59 до 12, копула -durur с 762 до 80. Во-вторых, современные формы резко возросли: клитический копулятив -dır увеличился с 258 до 486, более чем вдвое; оптатив -ayım/-alım вырос с 3 до 134; деепричастие -madan с 2 до 41; комбинация прошедшего времени + нарратив -mıştı с 0 до 65; современное деепричастие -arak с 9 до 51. В-третьих, несколько независимых синкатегорматических слов полностью архаизировались: mere (124 > 0), dahı
Диахроническое сравнение выявляет три различных модели изменений. Во‑первых, архаические суффиксы в значительной степени утратили свою функцию. Герундий -uban падает с 60 до 0, императив -gıl/-gil с 226 до 19, причастие + притяжательный суффикс -dügüm с 59 до 12, а копулятивная форма -durur с 762 до 80. Во‑вторых, современные формы резко возрастают. Клитический копулятив -dır увеличивается с 258 до 486, более чем вдвое. Оптатив -ayım/-alım возрастает с 3 до 134, герундий -madan с 2 до 41, комбинация прошедшего времени с нарративом -mıştı с 0 до 65, а современный герундий -arak с 9 до 51. В‑третьих, ряд независимых синкатегорематических слов полностью архаизируется. mere (124 > 0), dahı (114 > 0), karşu (51 > 0), meger (36 > 0) и içün (28 > 0) исчезают из современного языка; дистальный указательный ol падает со 118 до 5. В статистическом отношении критерий χ² показывает p < 0.001 для категорий падежа, времени и причастий. Плотностные значения, основанные на повествовании, имеют стандартное отклонение σ = 0.042, что свидетельствует о высокой морфологической однородности. Наклоны по закону Ципфа (независимые синкатегорематические ≈ -0.95; суффиксы ≈ -1.08) соответствуют ожидаемому языковому распределению.
Результаты показывают, что граница между категорематическими и синкатегорематическими элементами в турецком языке движется по трём различным траекториям. Во‑первых, переход от категорематического к синкатегорематическому. Сдвиг от полного глагола durur к сокращённому суффиксу -dır является прямым примером цепочки «лексическое слово > грамматическое слово > клитик > флективный аффикс», предложенной Hopper и Traugott (2003). Текст «Деде Коркут» сохраняет оба конца этой цепочки в синхронном сосуществовании, предоставляя тем самым «замороженный снимок» процесса фонологической эрозии. Во‑вторых, формальная замена внутри синкатегорематических категорий. -arak заменяет -uban, -dığım заменяет -dügüm, -ayım заменяет -ayum. Грамматическая функция сохраняется; изменяется лишь форма. В‑третьих, полная архаизация синкатегорематических слов. mere, dahı, karşu, meger и içün полностью исчезают из современного языка. Это показывает, что синкатегорематический класс может обновляться как по функции, так и по форме. Агглютинативная типология турецкого языка требует, чтобы анализ опускался ниже уровня слова. Анализ на уровне слова недооценивает синкатегорематическую нагрузку турецкого языка. Расширение на уровень морфемы документирует, что эта нагрузка сопоставима с аналитическими языками, такими как английский. Типология определяет не размер этой нагрузки, а место её распределения. В конечном итоге текст «Деде Коркут» является живой фотографией синкатегорематической трансформации за 500 лет турецкого языка. Разработанный здесь метод представляет собой шаблон, применимый к другим историческим текстам, таким как «Дивану Лугати ат-Турк», «Кутадгу Билиг» и диван Юнуса Эмре. Тем самым закладывается основа для картографирования тысячелетнего морфологического развития турецкого языка.
Ключевые слова: Деде Коркут, синкатегорематические выражения, морфологический анализ, грамматикализация, древнеанатолийский турецкий, историческая лингвистика, Хоппер‑Трауготт, корпусная лингвистика, агглютинативная типология, копулятивный суффикс -dır.
संरचित सारांश:
कैटेगोरमैटिक‑सिंकैटेगोरमैटिक भेद, जो मध्यकालीन स्कोलास्टिक तर्कशास्त्र से विरासत में मिला है, शब्दों को इस आधार पर दो वर्गों में विभाजित करता है कि वे अपने आप अर्थ वहन करते हैं या नहीं। कैटेगोरमैटिक पद (संज्ञा, विशेषण, क्रिया) स्वतंत्र अर्थ इकाइयाँ हैं और कर्ता या विधेय के रूप में कार्य कर सकते हैं। सिंकैटेगोरमैटिक पद (उत्तरपद, संयोजक, रूपात्मक प्रत्यय) केवल अन्य पदों के साथ संयोजन में अर्थ प्राप्त करते हैं। यह भेद अरस्तू की De Interpretatione में prossēmainein की धारणा से उत्पन्न हुआ, बोएथियस के लैटिन प्रसारण के माध्यम से आकार लिया, और विलियम ऑफ शेरवुड तथा पेड्रो हिस्पानो के ग्रंथों में व्यवस्थित हुआ (Kretzmann, 1982; Klima, 2006)। आधुनिक औपचारिक अर्थविज्ञान, भाषा दर्शन और भाषाविज्ञान ने इसी विभाजन को अपनाया। आज यह तार्किक स्थिरांकों पर बहस (MacFarlane, 2015) और कार्यात्मक शब्दों तथा बंधित रूपिमों पर भाषावैज्ञानिक कार्य के सैद्धांतिक पृष्ठभूमि में स्थित है।
हालाँकि, यह भेद विभिन्न प्रकारिकी प्रोफाइलों में अलग‑अलग रूप से लागू होता है। विश्लेषणात्मक भाषाओं जैसे लैटिन और अंग्रेज़ी में, सिंकैटेगोरमैटिक कार्य मुख्यतः स्वतंत्र शब्दों द्वारा वहन किया जाता है। आग्लूटिनेटिव भाषाओं जैसे तुर्की में, इसका अधिकांश कार्य मूल से जुड़े बंधित रूपिमों द्वारा किया जाता है। कारक, काल, संबंधवाचक, भाव, कृदंत और कृदंतात्मक प्रत्यय अपने आप में कोई अर्थ नहीं रखते। वे अपने मूल के साथ मिलकर वाक्य में शब्द की संबंधपरक भूमिका को संहिताबद्ध करते हैं। यह प्रकारिकी विशेषता तुर्की ग्रंथों के सिंकैटेगोरमैटिक प्रोफाइल का विश्लेषण शब्द स्तर पर ही नहीं बल्कि रूपिम स्तर पर भी आवश्यक बनाती है।
ददे कोरकुत कथाएँ ओग़ुज़ आख्यानों का एक मानक संग्रह हैं, जो मौखिक परंपरा और लिखित संस्कृति के संगम पर पुरानी अनातोलियन तुर्की से ओटोमन तुर्की में संक्रमण का दस्तावेज़ प्रस्तुत करती हैं (Ergin, 1989; Gökyay, 2000; Tezcan, 2001)। तीसरा पांडुलिपि, लंबे समय से ज्ञात ड्रेसडेन और वेटिकन प्रतियों के साथ, प्रो. डॉ. मेटिन एकिची द्वारा 25‑27 अप्रैल 2019 को बायबुर्ट में आयोजित संगोष्ठी में विद्वत समुदाय को प्रस्तुत किया गया। 31‑फोलियो पांडुलिपि, ईरान के गोलस्तान प्रांत के गोनबद‑ए कावुस क्षेत्र से उत्पन्न, भाषाई आधार पर अठारहवीं शताब्दी की है (Ekici, 2019)। अधिकांश अध्ययन साहित्यिक, विषयगत या सांस्कृतिक‑ऐतिहासिक प्रश्नों पर केंद्रित हैं। रूपात्मक प्रोफाइल, विशेष रूप से सिंकैटेगोरमैटिक रूपिमों का मात्रात्मक वितरण, अभी तक विस्तार से नहीं जाँचा गया है। इस अध्ययन का प्राथमिक उद्देश्य ड्रेसडेन पांडुलिपि के Özçelik (2016) के आलोचनात्मक संस्करण के आधार पर ऐसा रूपिम‑स्तरीय सूची प्रदान करना है। इसका द्वितीयक उद्देश्य सोलहवीं शताब्दी के आँकड़ों की आधुनिक तुर्की अनुवाद से तुलना करना और मात्रात्मक रूप से यह निर्धारित करना है कि कौन से रूप अप्रभावी हो गए हैं, कौन से बढ़े हैं और कौन से स्थिर रहे हैं। यह दूसरा उद्देश्य अध्ययन को केवल सूची तक सीमित न रखकर व्याकरणिकरण की व्याख्या में बदल देता है।
प्राथमिक कॉर्पस Özçelik (2016) का Dede Korkut – Dresden Manuscript: Text, Index का दूसरा खंड है, जिसे तुर्की भाषा समाज द्वारा प्रकाशित किया गया। लैटिन लिप्यंतरण के 279 सम संख्या वाले पृष्ठ (pp. 42‑598) संसाधित किए गए। प्रत्येक पृष्ठ को pdftoppm के माध्यम से 200 dpi रिज़ॉल्यूशन पर JPEG में परिवर्तित किया गया और फिर तुर्की भाषा मॉडल के साथ tesseract‑ocr (संस्करण 5.3.4) से चलाया गया। फुटनोट, पृष्ठ शीर्षक, फोलियो चिह्न और बिना संख्या वाली पंक्तियाँ स्वतः फ़िल्टर की गईं; केवल संख्या वाली मुख्य‑पाठ पंक्तियाँ रखी गईं। इस प्रक्रिया से 240 फोलियो से 26,254 शब्दों का कॉर्पस प्राप्त हुआ। विशेष फिलोलॉजिकल अक्षरों को मानक लैटिन अक्षरों में घटाया गया। मैनुअल सैम्पलिंग द्वारा OCR त्रुटि दर लगभग 2‑4% अनुमानित की गई। कालक्रमिक तुलना के लिए, 2009 का डिजिटल आधुनिक तुर्की संस्करण, जिसमें आठ कथाएँ और 22,862 शब्द शामिल हैं, द्वितीयक कॉर्पस के रूप में प्रयुक्त हुआ।
विशेष रूप से इस शोध के लिए सात‑स्तरीय regex‑आधारित रूपिम स्ट्रिपर विकसित किया गया। स्ट्रिपर दाएँ‑से‑बाएँ स्ट्रिपिंग को सबसे लंबे‑मिलान सिद्धांत के तहत लागू करता है, न्यूनतम मूल लंबाई दो ध्वनियों की है। परतें क्रमशः हैं: नकारात्मक/व्युत्पन्न प्रत्यय, बहुवचन प्रत्यय, संबंधवाचक प्रत्यय, कारक प्रत्यय, कृदंत और कृदंतात्मक प्रत्यय, काल और भाव प्रत्यय, और पुरुष/प्रश्नवाचक/संधि प्रत्यय। ओग़ुज़ तुर्की के प्राचीन रूप भी प्रत्यय सूची में जोड़े गए: -uban/-üben (कृदंत), -ubanı, -gıl/-gil (2sg आज्ञार्थक), -dügüm, -dukda, -durur/-dur, -iser/-ısar, -ayum/-eyüm, -madın/-medin। स्वतंत्र सिंकैटेगोरमैटिक शब्दों को आठ श्रेणियों में वर्गीकृत किया गया: संयोजक, परिमाणवाचक, निषेध और अस्तित्वहीनता शब्द, निर्धारक, उत्तरपद, प्रश्नवाचक कण, भाव‑आज्ञार्थक‑इच्छासूचक चिह्नक, और विस्मयादिबोधक/संवोधन रूप। यह वर्गीकरण तुर्की तुर्की के लिए Korkmaz (2014) द्वारा प्रस्तावित रूपात्मक रैंकिंग का विस्तार करता है ताकि ओग़ुज़ तुर्की के विशिष्ट रूपों को समायोजित किया जा सके। सांख्यिकीय मूल्यांकन प्रति 1,000 शब्दों पर सामान्यीकृत दरों, स्वतंत्रता के ची‑स्क्वायर परीक्षणों और Zipf‑ढलान विश्लेषण पर आधारित है।
सोलहवीं शताब्दी का कॉर्पस 2,824 स्वतंत्र सिंकैटेगोरमैटिक शब्द और 25,020 बंधित रूपिमों को सम्मिलित करता है। संयुक्त सिंकैटेगोरमैटिक भार 27,844 इकाइयाँ है और प्रति‑शब्द घनत्व 1.06 है। कथा‑स्तरीय घनत्व मान 1.00 और 1.15 के बीच संकीर्ण बैंड में समूहित होते हैं; यह स्थिरता अप्रत्यक्ष रूप से एकल‑लेखक धारणा का समर्थन करती है। बंधित रूपिमों में, कारक प्रत्यय कुल भार का 43.8% बनाते हैं, काल प्रत्यय 22.0% और कृदंत प्रत्यय 11.3%। सबसे अधिक बार प्रयुक्त बंधित रूपिम कर्मकारक -i है (3,691 उदाहरण, प्रति 1,000 शब्दों पर 140.6)। इसके बाद प्रत्यक्ष‑भूतकाल -dı/-di (3,546, 135.1) और सम्प्रदान कारक -a/-e (3,468, 132.1) आते हैं। ओग़ुज़‑तुर्की संबंधवाचक/संबंधवाचक रूप -ün चौथे स्थान पर 2,320 बार आता है और आधुनिक तुर्की -in में विकसित न होने वाले ओग़ुज़ बोली के निशान को दर्शाता है। सबसे अधिक प्रयुक्त स्वतंत्र सिंकैटेगोरमैटिक्स हैं bir (281), ne (196), ve (145), bu (139), göre (127), mere (124), ol (118), और dahı (114)।
कालक्रमिक तुलना तीन अलग-अलग परिवर्तन पैटर्न को उजागर करती है। पहला, प्राचीन प्रत्यय बड़े पैमाने पर अप्रभावी हो गए हैं। -uban कृदंत 60 से 0 तक गिरता है, -gıl/-gil आज्ञार्थक 226 से 19 तक, कृदंत + संबंधवाचक -dügüm 59 से 12 तक, और संधि रूप -durur 762 से 80 तक। दूसरा, आधुनिक रूप तीव्रता से बढ़ते हैं। क्लिटिक संधि -dır 258 से 486 तक बढ़ती है, यानी दोगुने से अधिक। इच्छासूचक -ayım/-alım 3 से 134 तक बढ़ता है, कृदंत -madan 2 से 41 तक, रिपोर्टेड-पास्ट + कथात्मक संयोजन -mıştı 0 से 65 तक, और आधुनिक कृदंत -arak 9 से 51 तक। तीसरा, कई स्वतंत्र सिंकाटेगोरमैटिक शब्द पूरी तरह से प्राचीन हो जाते हैं। mere (124 > 0), dahı (114 > 0), karşu (51 > 0), meger (36 > 0), और içün (28 > 0) आधुनिक संस्करण से अनुपस्थित हैं; दूरवर्ती संकेतक ol 118 से 5 तक गिरता है। सांख्यिकीय दृष्टि से, ची-स्क्वायर परीक्षण केस, काल और कृदंत श्रेणियों के लिए p < 0.001 लौटाता है। कहानी-आधारित घनत्व मानों का मानक विचलन σ = 0.042 है, जो उच्च रूपात्मक समानता को दर्शाता है। Zipf ढलान (स्वतंत्र सिंकाटेगोरमैटिक ≈ -0.95; प्रत्यय ≈ -1.08) अपेक्षित भाषाई वितरण प्रोफ़ाइल से मेल खाते हैं।
निष्कर्ष दिखाते हैं कि तुर्की में कैटेगोरमैटिक-सिंकाटेगोरमैटिक सीमा तीन अलग-अलग मार्गों पर आगे बढ़ती है। पहला, कैटेगोरमैटिक से सिंकाटेगोरमैटिक की ओर संक्रमण। पूर्ण क्रिया durur से संक्षिप्त प्रत्यय -dır की ओर बदलाव Hopper और Traugott (2003) द्वारा प्रस्तुत "सामग्री शब्द > व्याकरणिक शब्द > क्लिटिक > रूपात्मक प्रत्यय" श्रृंखला का प्रत्यक्ष उदाहरण है। ददे कोरकुत पाठ इस श्रृंखला के दोनों छोरों को समकालिक सह-अस्तित्व में रखता है, और इस प्रकार ध्वन्यात्मक क्षरण प्रक्रिया की एक स्थिर तस्वीर प्रस्तुत करता है। दूसरा, सिंकाटेगोरमैटिक श्रेणियों के बीच औपचारिक प्रतिस्थापन। -arak -uban को प्रतिस्थापित करता है, -dığım -dügüm को, -ayım -ayum को। व्याकरणिक कार्य बना रहता है; केवल रूप बदलता है। तीसरा, सिंकाटेगोरमैटिक शब्दों का पूर्ण प्राचीनकरण। mere, dahı, karşu, meger और içün आधुनिक भाषा से पूरी तरह गायब हो जाते हैं। यह दिखाता है कि सिंकाटेगोरमैटिक वर्ग कार्य और रूप दोनों में स्वयं को नवीनीकृत कर सकता है। तुर्की की आग्लूटिनेटिव प्रकारिकी आगे यह आवश्यक करती है कि विश्लेषण शब्द स्तर से नीचे जाए। शब्द-स्तरीय विश्लेषण तुर्की के सिंकाटेगोरमैटिक भार का कम प्रतिनिधित्व करता है। रूपिम-स्तरीय विस्तार यह दस्तावेज करता है कि यह भार अंग्रेज़ी जैसी विश्लेषणात्मक भाषाओं के तुलनीय है। प्रकारिकी यह निर्धारित करती है कि इस भार का आकार नहीं बल्कि यह कहाँ वहन किया जाता है। अंततः, ददे कोरकुत पाठ तुर्की में 500 वर्षों के सिंकाटेगोरमैटिक परिवर्तन की एक जीवित तस्वीर है। यहाँ विकसित की गई विधि अन्य ऐतिहासिक ग्रंथों जैसे दिवानु लुग़ातित-तुर्क, कुतादगु बिलिग और युनुस एमरे के दिवान पर लागू होने वाला एक टेम्पलेट है। इस प्रकार यह तुर्की के हजार वर्षीय रूपात्मक विकास का मानचित्रण करने की नींव रखता है।
कीवर्ड्स: ददे कोरकुत, सिंकाटेगोरमैटिक अभिव्यक्तियाँ, रूपात्मक विश्लेषण, व्याकरणिकरण, पुराना अनातोलियन तुर्की, ऐतिहासिक भाषाविज्ञान, Hopper-Traugott, कॉर्पस भाषाविज्ञान, आग्लूटिनेटिव प्रकारिकी, -dır संधि प्रत्यय.
By subscribing to E-Newsletter, you can get the latest news to your e-mail.