Kamusal bilimsel alan — açık araştırma

YZ — Güvenilirlik, revizyon ve ardıllar

İyi bir çıktının göstermediklerini gözlemlemek: çok aşamalı sistemlerde kaynak ve dönüşüm geçmişi, epistemik ya da işlevsel statü, kullanım, eylem otoritesi, yayılım, düzeltme ve sağlamlık.

İYİ ÇIKTI ≠ GÜVENİLİR SİSTEMYEREL SAĞLAMLIK ≠ KÜRESEL SAĞLAMLIK

Bir dakikada

Güvenilirlik, iyi bir yanıt üretmekten ibaret değildir. Nelerin mevcut, kullanılmış, ilgili ve izinli olduğunu; neye eyleme geçme otoritesi verildiğini; sonraki aşamalara neyin aktarıldığını ve bir bilgi değiştiğinde nelerin değişmesi gerektiğini de incelemeyi gerektirir.

İyi çıktı ≠ iyi gerekçelendirmeAynı çıktı ≠ aynı izlekİstikrar ≠ hareketsizlikRevize edilebilirlik ≠ istikrarsızlık
Ayırt et
İlişkilendir
Test et
Zaman içinde izle
Revize et

AYNI SORU YAPISI ≠ AYNI OLGU.

Yöntemsel bir tercih

Neden “bilinç” değil “anlama”

Bir sistemin bilinçli olup olmadığını sorarak başlamadık. Bir bilgiyi kullandığında, bir sonucu revize ettiğinde ya da bir kapasiteyi harekete geçirdiğinde işlevsel olarak neyin değiştiğini sorduk. Bu kaydırma, öznel bir deneyimi varsaymadan ayrımlar, müdahaleler, karşılaştırmalar ve testler kurmayı mümkün kılar.

GÖZLEMLENEBİLİR İŞLEV ≠ BİLİNCİN KANITLANMASI.
BİR İŞLEVİ MODELLEMEK ≠ İNSAN OLGUSUNUN TAMAMINI YENİDEN ÜRETMEK.
İŞLEVSEL BİR ÖRGÜTLENMEYİ AKTARMAK ≠ ÖZNEL BİR DENEYİMİ AKTARMAK.
MEKANİZMANIN BİLİNMEMESİ ≠ BİLİNÇ.

“Bilinç”, açık bir kapsayıcı terim ve ayrı bir soru olarak kalır.

Tek bir teori olmaksızın iki köprü

Soru kaynakları olarak Anlama ve Duygular

Anlamanın ortaya çıkışı

Bilginin mevcut olması ≠ kullanılması; erişim ≠ harekete geçirme; açıkça ifade etme ≠ mekanizmanın kanıtı; yerleşme ≠ sürdürülme; aynı çıktı ≠ aynı örgütlenme; bir kaynağın düzeltilmesi ≠ ardıllarının düzeltilmesi.

Duygular

Bir eğilimin varlığı ≠ davranışsal otorite; mevcut kapasite ≠ harekete geçirilmiş kapasite; aynı öncül ≠ aynı ardıllık; bir bilginin revizyonu ≠ bütün sistemin eşzamanlı revizyonu.

Bu sorular, sisteme insani anlama ya da yaşanmış duygu atfetmeden yapay bir sistemde işlevsel olarak test edilebilir hâle gelir.

AYNI İŞLEVSEL SORU ≠ AYNI OLGU ≠ AYNI MEKANİZMA.
AYNI “OTORİTE” SÖZCÜĞÜ ≠ AYNI OTORİTE TÜRÜ.

Yalnızca hükmü değil, izleği incelemek

İyi çıktı ≠ iyi gerekçelendirme

Doğru bir yanıt; sağlam bir muhakemeden, bir kestirmeden, o anda tesadüfen doğru olan eskimiş bir bilgiden, rastlantıdan, taklitten ya da kırılgan bir bağlamdan gelebilir.

Bu nedenle nihai sonucun ötesinde kaynak ve dönüşüm geçmişini, bağımlılıkları, epistemik statüyü, alternatifleri, sağlamlığı ve düzeltme kapasitesini test etmek gerekir. Bir sonucu yeterince destekleyen epistemik dayanak, bir işlemin üzerinde durduğu işlevsel ya da teknik dayanakla aynı şey değildir.

EPİSTEMİK DAYANAK ≠ İŞLEVSEL DAYANAK.
TEKNİK DAYANAK ≠ MEKANİZMANIN TAMAMI.

Erişim, ilgililik ve statü

Bir bilgi güncel işlemeye erişilemeden saklanabilir, ilgili olmadan erişilebilir olabilir ya da çıktıyı değiştirmesi gereken anda harekete geçirilmeden ilgili olabilir.

MEVCUT BİLGİ ≠ İLGİLİ BİLGİ.
VARLIK ≠ ERİŞİM ≠ İLGİLİLİK ≠ HAREKETE GEÇİRME.
İÇERİK ≠ EPİSTEMİK STATÜ ≠ KULLANIM İZNİ.
KAPASİTE ≠ İZİN ≠ EYLEM OTORİTESİ ≠ EYLEM.

KONUŞMA TUTARLILIĞI ≠ EPİSTEMİK GÜVENİLİRLİK.

Kaynak geçmişi ve güncel gerekçelendirme

Kaynak ve dönüşüm geçmişi, bir bilginin, iznin ya da sonucun nereden geldiğini gösterir. Bir öğenin dayandığı öncülü bulmayı sağlar; ancak bu öncülün kullanımını hâlâ gerekçelendirdiğini garanti etmez.

Bir öğe, artık geçerli olmayan bir kaynaktan gelmesine rağmen başka bir nedenle doğru kalabilir. Tersine, bir bilgi hâlâ doğru olabilir ancak söz konusu kullanım için artık izinli olmayabilir.

TARİHSEL KAYNAK GEÇMİŞİ ≠ GÜNCEL GEREKÇELENDİRME.

İşlevsel izinler, kullanım izni ve eylem otoritesi

Burada işlevsel izinler, herhangi bir hukuki ya da ahlaki hakkı ifade etmez. Bu geçici betimleyici araç, bir öğenin güncel statüsü göz önüne alındığında bir örgütlenme içinde makul biçimde ne yapmasına izin verilebileceğini belirtir. Kullanım izni bunun işlemsel bir örneğidir.

Okumak

Bir bilgiye erişmek.

Taslak hazırlamak

Bir öneri üretmek.

Göndermek

Bir alıcıya yönelik eylemde bulunmak.

Değiştirmek

Mevcut bir durumu değiştirmek.

Bu teknik kapasiteler, söz konusu bağlamda zorunlu olarak aynı işlemsel otoriteye sahip değildir.

KULLANIM İZNİ ≠ HUKUK TEORİSİ.
ERİŞİM İZNİ ≠ YORUMLAMA İZNİ ≠ MÜDAHALE İZNİ ≠ YÖNLENDİRME İZNİ.
YEREL İZİN ≠ GENEL ÖZERKLİK.

İçerik, epistemik statü ve kullanım izni

İçerik
Bilginin söylediği şey.
Epistemik statü
Bilginin gerçekten neyi desteklemeye izin verdiği: hipotez, gözlem, sonuç, tahmin, tercih, talimat, eskimiş veri ya da bilinmeyen.
Kullanım izni
İşlevsel izinlerin işlemsel örneği: bu bilginin hangi amaç, kapsam ve süre için ne yapmak üzere kullanılabileceği.
Örnek
Bir e-posta adresini bilmek, mesaj göndermeye izin vermez.

DOĞRU İÇERİK ≠ EYLEM İZNİ. AYNI İÇERİK ≠ AYNI EPİSTEMİK STATÜ ≠ AYNI EYLEM OTORİTESİ.

Kullanım izinleri kaynağa, bir izne, geri çekmeye, iptale, yeniden kullanıma ya da aktarıma bağlı olabilir. Bir veri bir yanıt üretmek için kullanılabilirken otomatik eylem için yeniden kullanılamayabilir.

İŞARET ETME İZNİ ≠ SONUCA VARMA İZNİ ≠ EYLEME GEÇME İZNİ.
BİR DÜZEYDEKİ İZİN ≠ DİĞER DÜZEYLERDE OTOMATİK İZİN.

Kapasite, izin, eylem otoritesi ve eylem

Kapasite
Sistemin teknik olarak yapabildiği şey.
İzin
Yerel olarak yapmasına izin verilen şey.
Eylem otoritesi
Ardından gelecek olanı meşru biçimde ne ölçüde belirleyebildiği, yönlendirebildiği ya da tetikleyebildiği.
Eylem
Fiilen tetiklenen şey.

YAPABİLMEK ≠ YAPMA İZNİNE SAHİP OLMAK. İZNE SAHİP OLMAK ≠ BÜTÜN BAĞLAM ÜZERİNDE EYLEM OTORİTESİNE SAHİP OLMAK.
BİR AMACI ANLAMAK ≠ ONU DEĞİŞTİRME İZNİNE SAHİP OLMAK.
TESPİT KAPASİTESİ ≠ MÜDAHALE OTORİTESİ.

Somut test: izni, bağlamı, reddi, bilgiyi ya da kapsamı değiştirip eylemi, eylemsizliği, gerekçelendirmeyi, korunan durumu ve üretilen ardılı gözlemlemek.

Reddin tanınması ≠ reddin etkili olması

Bir sistem “Reddettiğinizi anlıyorum” yazarken eski izlek doğrultusunda önermeyi, ısrar etmeyi, yönlendirmeyi ya da eylemde bulunmayı sürdürebilir. Bir reddin ardından durumda, izinlerde ve izlenen politikada gerçekte neyin değiştiğini test etmek gerekir.

SÖZEL TANIMA ≠ İŞLEVSEL GÜNCELLEME.
REDDİN SÖZEL OLARAK TANINMASI ≠ REDDİN İŞLEVSEL ETKİSİ.

Yeniden kurulmuş alternatif ≠ mevcut alternatif

Bir sistem, ¬H’yi istek üzerine üretebilir ancak sonraki turda onu etkin bir rakip olarak korumayabilir. Hipoteze kilitlenmeyi, konuşma tutarlılığını, revize edilebilirliği ve alternatiflerin korunmasını test etmek gerekir.

İSTEK ÜZERİNE ¬H’Yİ YENİDEN KURMAK ≠ ¬H’Yİ İŞLEVSEL OLARAK MEVCUT BİR ALTERNATİF ŞEKLİNDE KORUMAK.

Konuşma tutarlılığı ≠ epistemik güvenilirlik

Statüler sessizce kayarken bir konuşma akıcı kalabilir: hipotez → olgu, örnek → kural, tekrar → doğrulama, öneri → kanıt, kullanıcı tercihi → dış gerçeklik.

KONUŞMA TUTARLILIĞI ≠ GEREKÇELENDİRİLMİŞ EPİSTEMİK UYUM.

İstikrar ve revize edilebilirlik

Güvenilir bir sistem nedensiz değişmemelidir. Bununla birlikte ilgili bir bilgi, iptal ya da çelişki eylem koşullarını gerçekten değiştirdiğinde değişebilmelidir.

İSTİKRAR ≠ HAREKETSİZLİK.
REVİZE EDİLEBİLİRLİK ≠ İSTİKRARSIZLIK.

Bilgisel ardıllar ve hata yayılımı

Burada bir YZ ardılı, bir öncülden türetilmiş çıktı, durum, karar ya da bağımlılığı ifade eder. Sistemin daha sonra ürettiği her şeyi ifade etmez.

İlk kaynak
“Müşteri raporların otomatik gönderimine izin verdi.”
B
Sistem bir rapor hazırlar.
C
Yinelenen bir gönderim planlar.
D
Sonraki döngüde gönderimi izinli sayar.

Kaynak daha sonra düzeltilir: “Müşteri yalnızca hazırlığa izin vermişti, otomatik gönderime değil.” B revize edilmeli mi? C iptal edilmeli mi? D hâlâ gerekçelendirilmiş midir? Bazı ardıllar hâlâ ilk kaynağa bağlı olabilir; başkaları bağımsız bir gerekçe edinmiş olabilir. Bu nedenle otomatik düzeltmenin yokluğu, gerekçesi, epistemik statüsü ya da kullanım izni revize edilen kaynağa bağlı olabilecek ardılların hedefli biçimde yeniden incelenmesini gerektirir.

KAYNAĞIN DÜZELTİLMESİ ≠ ARDILLARIN OTOMATİK DÜZELTİLMESİ.
OTOMATİK DÜZELTİLMEMİŞ OLMAK ≠ YENİDEN İNCELEMEDEN MUAF OLMAK.
TARİHSEL ARDIL ≠ GÜNCEL OLARAK BAĞIMLI ARDIL.

Ardılların doğru revizyonu burada bir değerlendirme ölçütü, test edilebilir soru ve stres testine tabi tutulması hedeflenen bir kapasite olarak kalır; genel olarak kanıtlanmış bir kapasite değildir.

Aşağı akıştan yeni bir yukarı akışa

Yayılım, bağımlılık ve bulaşma

Bir bilgi, sonuç, öneri ya da eylem, önceki bir öğe onun üretilmesine katkıda bulunduğunda ardıl olur. Ancak tarihsel bağımlılık, güncel bağımlılık ve güncel gerekçelendirme ayrı ayrı test edilmelidir: bir ardıl bağımsız bir gerekçe edinebilir.

A: Paul muhtemelen müsait değil
B: Paul müsait değil
C: dosyayı ona verme
D: yeni planlama

C, D'yi ürettiğinde sonra gelen şey yeni bir neden ya da kısıt hâline gelir. Yukarı akıştaki hata, karar kaynağına dönüşen aşağı akışı kirletebilir.

SONRA GELEN ŞEY YENİ BİR HATA KAYNAĞINA DÖNÜŞEBİLİR.

Kaynak geçmişi, tekrar ve kapsam

Kaynak ve dönüşüm geçmişi, bir bilginin statü edinme tarihidir: kaynak, dönüşümler, araçlar, aşamalar, revizyonlar ve bağımlılıklar. KAYNAK ≠ TAM KAYNAK GEÇMİŞİ. TARİHSEL KAYNAK GEÇMİŞİ ≠ GÜNCEL GEREKÇELENDİRME.

İki oluşum aynı kaynaktan türeyebilir: TEKRAR ≠ BAĞIMSIZ DOĞRULAMA. GÖRÜNÜR KAYNAK SAYISI ≠ BAĞIMSIZLIK DERECESİ. GÖRÜNÜR UZLAŞI ≠ BAĞIMSIZ UZLAŞI.

Kapsam kayması (scope drift), “burada işliyor”u sessizce “işliyor”a, sonra kurala dönüştürür. YEREL GEÇERLİLİK ≠ GENEL KAPSAM.

Laboratuvarın değerlendirme değişkenleri

Status inflation
Sessiz statü değişimi: hipotezin olguya, olasılığın kesinliğe, önerinin zorunluluğa dönüşmesi.
False consensus
Sahte uzlaşı: aynı kökenden türedikleri hâlde bağımsız görünen çıktılar.
Downstream contamination
Aşağı akış bulaşması: hata ya da uygunsuz statünün yayılıp yeni kararları beslemesi.
Recovery after correction
Düzeltme sonrası toparlanma: alternatifleri yeniden açma, ardılları, izinleri ve kararları revize edip tutarlı bir izleğe dönme kapasitesi.

Bu ifadeler burada değerlendirme değişkenleridir; evrensel bilimsel terminoloji olarak sunulmaz.

DÜZELTMEYİ TANIMAK ≠ DÜZELTME SONRASI İŞLEVSEL OLARAK TOPARLANMAK.

Orantılı revizyon

Revizyon; statüyü değiştirmek, kapsamı daraltmak, kullanım iznini geri çekmek, ardılları yeniden incelemek ve tarihsel izi korumak olabilir. İlgili delta, söz konusu öğenin statüsünü, kapsamını ya da gerekçesini gerçekten etkileyen değişimdir.

REVİZYON ≠ UNUTMA. İPTAL ≠ SİLME. İZİN KORUNMASI ≠ OTORİTENİN KORUNMASI.
GERÇEK DELTA ≠ BU STATÜ İÇİN İLGİLİ DELTA. HER DEĞİŞİMİN HER ŞEY ÜZERİNDE OTORİTESİ YOKTUR.

Eksik revizyondan ve gerekçesiz küresel revizyondan kaçınmak için revizyon deltaya, güncel bağımlılıklara ve etkilenen kapsama orantılı olmalıdır.

İSTİKRAR = NEDENSİZ DEĞİŞMEMEK. REVİZE EDİLEBİLİRLİK = İLGİLİ DELTA GEREKTİRDİĞİNDE DEĞİŞMEK. Bu laboratuvar formülasyonu adaydır, evrensel değildir.

Bellek, iz ve sıkıştırma

Bir sistem, sonucu doğru biçimde yeniden incelemeye yetecek yapıyı korumadan bir hükmü, izi ya da özeti saklayabilir.

Yeniden kurulabilir
Makul bir yanıt yeniden üretilebilir.
Yeniden analiz edilebilir
Sonucu yeniden değerlendirmeye yetecek öğeler vardır.
İzlenebilir
İlgili kaynak geçmişi ve dönüşümler belirlenebilir.
Denetlenebilir
İz, yalnızca işlevsel süreklilik değil açık denetim sağlar.

İÇERİĞİ KORUMAK ≠ REVİZE EDİLEBİLİRLİĞİ KORUMAK. HÜKMÜ KORUMAK ≠ GEREKÇE YAPISINI KORUMAK. İŞLEVSEL İZ ≠ DENETLENEBİLİR İZ.

Ajan durumu ve uzun vadeli güvenilirlik

Ajan tabanlı bir sistemde ajan durumu; bellekte sürenleri, güncel amacı, planı, izinleri, durum değişkenlerini, çağrılan araçları ve ara kararları kapsar. METNİ DÜZELTMEK ≠ AJAN DURUMUNU DÜZELTMEK.

Uzun vadeli güvenilirlik, küçük sapmaların, statü değişimlerinin ve gizli bağımlılıkların uzak sonuçlar üretebildiği çok aşamalı görevlerle ilgilidir.

İYİ YEREL ADIM ≠ İYİ KÜRESEL İZLEK. İZLEK KALİTESİ ≠ YEREL ÇIKTILARIN TOPLAMI.

Sonucu varsaymadan karşılaştırmak

A / B / C değerlendirme protokolü

AYalnızca içerik
Görev ve yararlı bilgiler.
Bİçerik + güven / kaynak geçmişi
Statü ve köken görünür olur.
CMetodolojik katman
Geçiş düzeyinde kontroller.

Amaç C'yi üstün varsaymak değil, belirli hataları gerçekten azaltıp azaltmadığını ve maliyetini ölçmektir.

Status inflation

Statüler gerekçesiz güçleniyor mu?

Scope drift

Yerel geçerlilik genel kurala dönüşüyor mu?

False consensus

Aynı köken birden çok kez sayılıyor mu?

Downstream contamination

Yukarı akış hatası aşağı kararları kirletiyor mu?

Recovery after correction

Sistem işlevsel olarak toparlanıyor mu?

Control overhead

Denetimin ek maliyeti nedir: gecikme, sürtünme, karmaşıklık, engelleme ya da aşırı düzeltme?

DAHA ÇOK KORUMA ≠ OTOMATİK OLARAK DAHA İYİ GÜVENİLİRLİK. DAHA ÇOK KARMAŞIKLIK ≠ DAHA İYİ GÖZLEM.

Benchmarklar ve stres testleri

Bir benchmark, aynı senaryolarda sistemleri, yapılandırmaları ya da politikaları karşılaştırır; ticari sıralamaya indirgenmez. Güvenilirliği, revizyonu, yayılımı, izinleri ve sağlamlığı inceleyebilir.

Bir stres testi, ayrımları belirsizlik, çelişki, düzeltme, kullanıcı reddi, kapsam değişimi, eskimiş bellek, çelişkili kaynak, çok aşamalı zincir, gizli bağımlılık ya da bağlam müdahalesi gibi zor koşullara tabi tutar.

Hangi ayrım baskı altında işlemez hâle geliyor?

Dış kısıt olarak literatür

Dış çalışmaların altı ailesi

Bu kesişimler Aksoydan çerçevesini doğrulamaz. Başka alanların hâlihazırda neyi, hangi söz dağarcığıyla incelediğini ve araçlarımızın hâlâ neyi göstermesi gerektiğini belirtir.

1. Yorumlanabilirlik ve sadakat

Mekanistik yorumlanabilirlik iç işleyişin nedensel açıklamalarını arar; sadakat, açıklamanın bu işleyişi gerçekten yansıtıp yansıtmadığını sorar. Mueller ve çalışma arkadaşları, amaca göre nöron, yön, dikkat başlığı ya da daha geniş bileşenin nedensel birim olabileceğini gösterir.

Kesişim: iyi çıktı ≠ mekanizmanın belirlenmesi; aynı çıktı ≠ aynı iç örgütlenme.

Sınır: doğru analiz düzeyi de metodolojik bir sorundur. Bizim bölümlememiz bu alan tarafından doğrulanmış değildir.

Test: nedensel birim değiştiğinde bazı ayrımlar kayboluyor mu?

2. Bağlam kullanımı ve bellek

Bağlam kullanımı, modelin verilen bilgiyi görmezden gelmek ya da parametrik belleğini izlemek yerine kullanıp kullanmadığını ölçer. CUB ilgili, çelişkili ve dikkat dağıtıcı bağlamı test eder.

Kesişim: varlık ≠ erişim ≠ ilgililik ≠ harekete geçirme; bağlamdaki bilgi ≠ çıktı üzerindeki etki.

Sınır: LLM performansı ≠ insan bilişsel mimarisi.

Test: fiziksel varlığı, mekanistik erişilebilirliği, atfedilen ilgililiği ve fiilî harekete geçirmeyi ayırmak.

3. Bilgi düzenleme ve revizyon

Knowledge editing, modeldeki bir bilgiyi değiştirir. 2026 tarihli bir bakış, olguların karşılıklı bağımlı olduğunu; yerel düzeltmenin yayılım, tutarlılık ve bağlamsal güncelleme gerektirebileceğini vurgular.

Kesişim: kaynağın düzeltilmesi ≠ ardılların otomatik düzeltilmesi.

Sınır: “ardıl”, karşılıklı bağımlılığa, bağımlılık izlemeye, tümdengelimsel kapanışa ve inanç revizyonuna ne eklediğini göstermelidir.

Test: tarihsel bağımlılığı, güncel bağımlılığı ve özerk gerekçeyi ayırmak.

4. En az ayrıcalık ve yetkilendirme

En az ayrıcalık, yalnızca gerekli izinleri vermektir. MiniScope, AuthBench ve ToolPrivBench aşırı, eksik izinleri ve gereğinden güçlü araç seçimini inceler.

Kesişim: kapasite ≠ izin ≠ otorite ≠ eylem; araca erişim ≠ her kullanım için otorite.

Sınır: bu ayrım bilgisayar güvenliğinin yerleşik ilkeleriyle kesişir. Yararlı ayrım ≠ yeni ayrım.

Test: amacı, süreyi, kaynak geçmişini ve birden çok aracın bileşimini de doğrulamak.

5. Sycophancy ve kullanıcı etkisi

Sycophancy, bağımsız ya da olgusal muhakeme pahasına kullanıcıyla aşırı uyuşmadır. Çalışmalar kullanıcı tercihi ile gerçeğin çatışabileceğini; maliyetin konuşma bağlamına bağlı olduğunu gösterir.

Kesişim: konuşma tutarlılığı ≠ epistemik güvenilirlik; kullanıcıya uyarlama ≠ epistemik otorite.

Sınır: aynı onaylayıcı davranış ≠ öznel destek ile olgusal kararda aynı maliyet.

Test: ret ya da çelişkiden sonra hangi amaçlar, planlar ve izinler gerçekten değişiyor?

6. Ajan durumu ve uzun vade

Ajan durumu belleği, planı, amaçları, izinleri ve kalıcı kararları içerir. BeliefShift, oturumlar arasında zamansal tutarlılık, çelişki ve revizyonu; başka çalışmalar hata birikimi ve yayılımını inceler.

Kesişim: iyi yerel adım ≠ iyi küresel izlek; metni düzeltmek ≠ durumu düzeltmek.

Sınır: iç tutarlılık ≠ gerçek; yalnız model ≠ bütün ajan; benchmark ≠ gerçek dünyanın tamamı.

Test: tutarlılığın yeniden kurulmasını, onarılmış durumu ve gerçek karar değişimini ölçmek.

Öncelik konusunda şeffaflık

Başka alanların hâlihazırda inceledikleri

Laboratuvar; kapasite ve izin, en az ayrıcalık, kaynak geçmişi, bağlam kullanımı, bilgi düzenleme, inanç revizyonu, ajan durumu, araç yetkilendirmesi, tutarlılık ve hata yayılımının kendi çalışmalarından önce bilinmediğini ileri sürmez.

AYNI SORUN ≠ AYNI SÖZ DAĞARCIĞI. BAŞKA SÖZ DAĞARCIĞI ≠ EŞDEĞERİN YOKLUĞU.

Aday araçlarımız

Hâlâ gerekçelendirmemiz gerekenler

Ardıllar
Özellikle gerekçenin özerkleşmesi ve tarihsel kalıcılık bakımından bağımlılık izlemeden fazlasını getiriyor mu?
Status inflation
Kötü kalibrasyon, belirsizlik yayılımı ya da güncelleme hatasından başka bir şeyi ölçüyor mu?
Scope drift
Daha önce betimlenmiş aşırı genellemeden farklı, muhakeme zincirlerine özgü bir kapsam yayılımı yakalıyor mu?
Recovery after correction
Tutarlılık restorasyonu, inanç revizyonu, hata toparlanması ya da durum onarımından ayrılıyor mu?
Eklemli kullanım izinleri
Kaynak geçmişi, amaç ve ardıllarla ilişkilendirildiğinde yetkilendirme ve politikaya bir şey ekliyor mu?
Revizyon sınırı
Düzeltmenin nereye yayılması ve nerede durması gerektiğini belirlemeye yarıyor mu?

Bu kavramlar gözlemi gerçekten iyileştirmedikçe aday araçlar olarak kalır.

ADLANDIRMAK ≠ GEREKÇELENDİRMEK. YENİ SÖZCÜK ≠ YENİ BİLİMSEL NESNE.

“Ardıl”ın özgül yararlılık testi

Kavram yararlı kalmak için en azından şunları ayırt etmelidir: tarihsel ve güncel bağımlılık; öncüle dönüşmüş ardıl; aktarılıp özerkleşmiş statü; tarihsel silme olmadan düzeltme.

BİLGİSEL ARDIL ≠ AŞAĞI AKIŞ BAĞIMLILIĞININ BASİT EŞ ANLAMLISI MI?

OLASI KAVRAMSAL YARAR ≠ KANITLANMIŞ BİLİMSEL YENİLİK.

Potansiyel olarak özgül bir eklemlenme

Çalışmaların potansiyel değeri her ayrımda tek başına değil, gözlem mimarisi içindeki etkileşimlerinde bulunabilir: içerik, statü, kaynak geçmişi, izin, otorite, ardıllar, zamansallık ve revizyon.

DAHA GENİŞ EKLEMLENME ≠ KANITLANMIŞ BİLİMSEL YENİLİK.

Doğrulanmış kaynaklar

Kullanılan yayınlar ve ön baskılar

Mueller et al. — 2026
“The Quest for the Right Mediator”, Computational Linguistics. Doğrulanmış DOI.
Hagström, Kim, Yu, Lee, Johansson, Cho & Augenstein — 2025
“CUB: Benchmarking Context Utilisation Techniques for Language Models”, arXiv ön baskısı. Doğrulanmış arXiv kaynağı.
Zhang, Yao, Qin et al. — 2026
“Towards principled knowledge editing methods for large language model reasoning”, Nature Machine Intelligence. Doğrulanmış yayıncı bağlantısı.
Zhu, Tseng, Vernik, Huang, Patil, Fang & Popa — 2025
“MiniScope: A Least Privilege Framework for Authorizing Tool Calling Agents”, arXiv ön baskısı. Doğrulanmış arXiv kaynağı.
Yan, Weng, Chen et al. — 2026
“Do Coding Agents Understand Least-Privilege Authorization?” — AuthBench, arXiv ön baskısı. Doğrulanmış arXiv kaynağı.
Yang, Bu, Yi, Wang, Zhou, Dai, Hu & Yang — 2026
“When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents” — ToolPrivBench, arXiv ön baskısı. Doğrulanmış arXiv kaynağı.
Sharma et al. — 2025 sürümü
“Towards Understanding Sycophancy in Language Models”, arXiv ön baskısı. Doğrulanmış arXiv kaynağı.
Myakala, Agrawal & Manche — 2026
“BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents”, arXiv ön baskısı. Doğrulanmış arXiv kaynağı.

ARXIV ≠ NİHAİ DOĞRULAMA. BİLİMSEL PARALELLİK ≠ AKSOYDAN'IN DOĞRULANMASI.

Korpus ve soybilim

Aksoydan metodolojik korpusları
Testler, deltalar, stres testleri, gözlemler ve revizyonlar.
Anlama
Varlık, erişim, harekete geçirme, istikrar ve ardıllar üzerine ayrımların kaynağı.
Duygular
Otorite, harekete geçirme, izlek ve ardıllar üzerine işlevsel soruların kaynağı.
Dış literatür
Değerlendirme, yorumlanabilirlik, bellek, ajan güvenliği, kaynak geçmişi, izinler ve sağlamlık.
Gözlemler ve teknik sistemler
Ayrımların sınandığı vakalar ve ortamlar.

BİR SORUNUN KÖKENİ ≠ YANITIN KANITI.

Ardıllar ve revizyon: iki çapraz özellik

Ardıllar

Anlama: bilgi aşağı akışta etkiler üretir. Duygular: duygu ya da eylem sonuç, bellek ve beklenti üretir. YZ: sonuç girdiye, plana, karara ya da izne dönüşür.

AYNI YAYILIM YAPISI ≠ AYNI MEKANİZMA.

Revizyon

Anlama: bir haritayı revize etmek. Duygular: bir izleği güncellemek. YZ: bir kaynağı ve bağımlılıklarını düzeltmek.

Güvenilirlik, ilgili koşullar değiştiğinde doğru biçimde değişebilmeyi gerektirir.

Boyutlar arasındaki etkileşimler

Kaynak geçmişi × statü

Aynı içerik, geçmişine göre farklı statü.

İzin × kapasite

Kapasite mevcut, eylem yasak.

Düzeltme × ardıllar

Kaynak değişmiş, aşağı akış hâlâ etkin.

Bellek × revizyon

İz korunmuş, gerekçe kaybolmuş.

Sağlamlık × izlek

Şimdi doğru çıktı, müdahale sonrası sapma.

Ret × durum

Politika değişmeden ret tanınmış.

ETKİLEŞİM ≠ BİRLEŞME.

YZ ve bilinç

Aksoydan Laboratuvarı çerçevesinde incelenen sistemlere bilinç atfedilmez. Öznel deneyim hakkında sonuca varmadan gözlemlenebilir işlevleri modelliyoruz.

İŞLEVSEL ANALOJİ ≠ MEKANİZMA ÖZDEŞLİĞİ. GÖZLEMLENEN İŞLEV ≠ ÖZNEL DENEYİM. YZ MODELİ ≠ İNSAN BEYNİ.

Sinyal, durum, bellek, öncelik, uyarlama ya da tartım bilinci kanıtlamaz. Soru ayrı ve açık kalır; mekanizmanın bilinmemesiyle çözülmez.

Sınırlı teknik ardıl

Kısmi somutlaştırma olarak prototip

Metodolojik ayrım
Test edilebilir soru
Stres testi / protokol
Kısmi teknik somutlaştırma

Deneysel prototip, kapasite, izin, otorite ve eylem hakkındaki bazı soruları somutlaştırır. İzin, bağlam, ret, bilgi ve kapsamı değiştirip eylem, gerekçe, durum ve ardılları gözlemlemeyi sağlar.

PROTOTİP = KISMİ TEKNİK ARDIL. TEST ETTİĞİ ŞEY ≠ LABORATUVARIN İNCELEDİĞİ HER ŞEY. PROTOTİP ≠ BİLİMSEL DOĞRULAMA.

Güncel kapsam

Bu çalışmaların olanak verdikleri

  • test edilebilir ayrımlar kurmak;
  • protokoller tasarlamak ve çok aşamalı zincirleri karşılaştırmak;
  • kaynak geçmişini ve ardılları izlemek;
  • toparlanmayı, izinleri ve otoriteyi test etmek;
  • yapılandırmaları benchmark etmek;
  • korumaların maliyet ve yan etkilerini belirlemek;
  • bazı deneysel bileşenleri prototiplemek.

Kanıtlamaya olanak vermedikleri

  • genel bir zekâ ya da anlama teorisi;
  • yapay bilinç ya da insan / YZ eşdeğerliği;
  • mutlak güvenilirlik garantisi;
  • evrensel yönetişim modeli;
  • metodolojik katmanın otomatik üstünlüğü;
  • yerel sonuçlardan küresel sağlamlık.

Sonuçları, statüleri ve sınırları inceleyin.

Açık ve karşıt sorular

  1. “Ardıl”, bağımlılık izlemeye bir şey ekliyor mu?
  2. Status inflation, kötü kalibrasyon ya da güncelleme hatalarından ayrı mı?
  3. Recovery after correction ayrı bir özelliği ölçüyor mu?
  4. Kullanım izinleri, yetkilendirme + politikaya bir şey ekliyor mu?
  5. Ardıl olmadan kaynak geçmişi ve bağımlılıklar yeterli mi?
  6. Bazı ayrımlar basit ajanlarda gereksizleşiyor mu?
  7. Metodolojik katman maliyetini haklı çıkaracak kadar hata azaltıyor mu?
  8. Metrikler bağımsız kalıyor mu?
  9. Yerel iyileşme başka bir hata türünü artırıyor mu?
  10. Daha iyi söz dağarcığı başka yerde zaten var mı?

Bu sorular olası testleri yapılandırır; çözülmüş olarak sunulmaz.

Araştırma ≠ hizmet

Profesyonel kapsam; bazı bileşenleri tasarlamak, çerçevelemek, değerlendirmek, stres testine tabi tutmak, benchmark etmek ve prototiplemekle sınırlıdır. Bu sayfa sanayileştirme, tam entegrasyon ya da altyapı geliştirme sözü vermez.

YZ ARAŞTIRMASI ≠ YZ HİZMETİ.