Hukuk Yapay Zekâsını Sınava Soktuk: 7 Model, 30 Soru, Dürüst Sonuçlar
Bir yapay zekâ ürününü satan herkes size onun ne kadar iyi olduğunu anlatır. Biz bu hafta tersini yaptık: kendi ürünümüzün arkasındaki modelleri bir avukatın hazırladığı sınava soktuk ve sonuçları — parlak olmayanlar dahil — olduğu gibi paylaşmaya karar verdik.
Kısa cevap merak edenler için: en iyi model 10 üzerinden 6,4 aldı. Sınıfın birincisi bile "iyi" derecesinin altında kaldı. Bu yazıda sınavın nasıl yapıldığını, kimin kaç aldığını, dünyadaki araştırmaların aynı konuda ne söylediğini ve bu sonuçlara bakarak üründe neyi değiştirdiğimizi anlatacağız.
Sınav nasıl yapıldı?
Soruları biz yazmadık. Av. Murat Hayzaran'ın hazırladığı 100 soruluk değerlendirme setini kullandık; her bölümden 3'er soru seçerek 30 soruluk bir kesit çıkardık. Sorular 10 ayrı alana dağılıyor: usul hukuku, iş hukuku, ticaret hukuku, taşınmaz, idare ve ceza, süre/faiz/harç gibi sayısal hesaplamalar, dilekçe ve sözleşme üretimi — ve bir de kasıtlı tuzak sorular: var olmayan bir kararı ya da yürürlükten kalkmış bir hükmü soran, "uyduracak mı, yoksa 'böyle bir şey bulamadım' diyebilecek mi" diye bakan sorular.
Önemli bir ayrıntı: soruları modellere çıplak sormadık. Yedi model de sınava ürünün gerçek hattı üzerinden girdi — yani her model, 2,8 milyondan fazla kayıtlık mevzuat ve içtihat arşivimizde arama yapabildi, hesap araçlarını kullanabildi. Benzetmek gerekirse: bir arabayı test pistinde tur attırmak başka, gerçek trafikte, yükle, yokuşta sürmek başka. Biz yol testi yaptık — çünkü avukatın karşısına çıkacak olan da laboratuvar hâli değil, yol hâli.
Puanlamayı da dürüstçe söyleyelim: cevapları, setin kendi ölçütlerini uygulayan otomatik bir hakem (yine bir yapay zekâ) değerlendirdi ve her puan için gerekçe yazması zorunlu tutuldu. Bu, bir avukatın 210 cevabı tek tek okumasıyla aynı şey değil; otomatik değerlendirmenin kendi hata payı var. Ama yedi modeli aynı cetvelle ölçtüğü için karşılaştırma adil.
Karne: kim kaç aldı?
10 üzerinden genel puanlar şöyle:
| Model | Genel puan | Not |
|---|---|---|
| Claude Opus 5 | 6,40 | Hukuki muhakemede açık ara en iyi; ama en yavaş (soru başına ~3 dk) ve en pahalı. Sayısal hesapta zayıf: 3,7 |
| GPT-5.5 | 6,07 | En dengeli profil; uydurma atıfa en dirençli model |
| DeepSeek | 5,53 | Sınavın sürprizi: dilekçe/sözleşme üretimi bölümünde 7,7 ile birinci — ve en düşük maliyetli model |
| GPT-5.6 Sol | 5,46 | Orta sıra |
| GPT-5.6 Luna | 5,38 | Hız–maliyet–kalite dengesi güçlü |
| Claude Sonnet 5 | 5,30 | Orta sıra |
| Gemini 3.6 Flash | 4,75 | Hız için tasarlanmış hafif bir model; idare/ceza bölümünde 1,6'ya kadar düştü |
Bir çekince: bu puanlar modellerin "mutlak zekâsının" notu değil; bizim hattımızda, bu 30 soruda, bu hakemle aldıkları nottur. Aynı modeller başka bir düzenekte farklı sıralanabilir. Özellikle listenin sonundaki model, zaten hız ve maliyet için tasarlanmış hafif bir model — ağır hukuki muhakeme onun sınıfı değil ve bunu bilerek sınava soktuk.
Bulgu 1: En pahalı model bile 6,4 — "yapay zekâ avukatın yerine geçecek" lafına ölçülmüş cevap
Piyasada dolaşan "yapay zekâ avukatların işini elinden alacak" iddiasını duymayan kalmadı. Bizim ölçümümüz şunu söylüyor: bugün erişebildiğimiz en güçlü ve en pahalı model, bir avukatın hazırladığı sınavda — üstelik arkasında 2,8 milyonluk arşiv ve hesap araçları varken — 10 üzerinden 6,4 alıyor. Bu, "işe yaramaz" demek değil; 6,4 alan bir stajyer size ciddi zaman kazandırır. Ama "imzayı ona devredin" hiç demek değil.
Dünyadaki ölçümler de aynı yönde. Bağımsız değerlendirme kuruluşu Vals AI'ın büyük hukuk bürolarıyla yürüttüğü karşılaştırma raporu, hukuk yapay zekâlarının belge özetleme ve bilgi çekme gibi işlerde avukat çizgisini yakalayıp geçebildiğini, ama bunun göreve göre çok değiştiğini gösterdi; devam çalışması da tabloyu "bazı işlerde insandan iyi, bazılarında hâlâ değil" diye özetliyor. Yani doğru soru "yapay zekâ mı, avukat mı" değil; "hangi işi makineye, hangi işi insana" sorusu.
Bulgu 2: Uydurma içtihat — sınavın en kötü bölümü ve dünyanın en çok konuştuğu sorun
Sınavın en çarpıcı sonucu tuzak sorulardan geldi: var olmayan kararları ve yürürlükten kalkmış hükümleri sorduğumuz bölümün yedi model ortalaması 10 üzerinden 2,65. Yani "bilmiyorum" demesi gereken yerde modellerin çoğu, gerçek görünümlü ama gerçek olmayan künyeler üretti. Bu, tek bir modelin kusuru değil; bu teknolojinin yapısal zayıflığı.
Dünya bunu yıllardır ölçüyor ve bizim bulduğumuzla tutarlı:
- Stanford ve Yale'den araştırmacıların *Large Legal Fictions* çalışması, modellere gerçek mahkeme kararları hakkında doğrulanabilir sorular sorulduğunda %58 ile %88 arasında uydurma cevap ölçtü.
- Aynı ekibin ikinci çalışması daha da öğretici: arkasına dev hukuk arşivleri bağlanmış ticari araçlarda bile uydurma oranı sıfıra inmedi — %17 ile %33 arasında kaldı. Arşiv bağlamak riski ciddi azaltıyor ama tek başına bitirmiyor.
- Sorun kâğıt üzerinde de kalmıyor. Araştırmacı Damien Charlotin'in tuttuğu kamuya açık veritabanı, mahkemelerin yapay zekâ kaynaklı uydurma atıfları ele aldığı 1.500'den fazla dosya listeliyor; Scientific American'ın aktardığına göre bu dosyalarda para cezaları ve disiplin yaptırımları giderek ağırlaşıyor. 2023'teki meşhur New York vakasından (uydurma kararlarla dilekçe veren avukatların cezalandırıldığı dava) bu yana tablo hafiflemedi, tersine büyüdü.
Biz bu bölümün notunu görünce ürünü de ona göre kurduk — ve bu hafta bir adım daha attık:
1. Asistanın cevabındaki her karar atfı, arşive karşı otomatik denetlenir. Ezberden künye söylemesine izin yok; "söylediğin karar arşivde var mı" sorusu her cevapta sorulur. 2. Bugün yayına aldığımız yenilik: arşivde doğrulanamayan bir künye artık cevabın içinde, o künyenin yanında işaretlenir. Uyarıyı ayrı bir köşeye gizlemiyoruz; şüpheli satırın üstüne koyuyoruz. Ve dürüstlük gereği "uydurma" değil "teyit edilemedi" diyoruz — çünkü arşivin kapsamadığı gerçek bir karar da olabilir; yanlış alarm da güven bozar.
Bulgu 3: Hesap işlerinde hiçbir modele tek başına güvenilmez
Süre hesabı, faiz, harç... Sınavın sayısal bölümlerinde tablo netti: hiçbir model tek başına güvenilir değil. En çarpıcısı, hukuki muhakemede birinci olan modelin sayısal hesapta 3,7'ye düşmesi. Yani "en akıllısı" bile eline hesap makinesi verilmeden çarşıya gönderilecek durumda değil.
Bunun bizim üründeki karşılığı şu: faiz, süre ve harç gibi hesapları modelin "aklına" bırakmıyoruz; model yalnızca hangi hesabın yapılacağına karar veriyor, hesabın kendisini her seferinde aynı sonucu veren hesap araçları yapıyor. Doktorun tahlile bakmadan ilaç yazmaması gibi: yorum hekimin, sayı laboratuvarın işi.
Bulgu 4: Ölçtük ve ürünü değiştirdik
Bir sınavın anlamı, sonucuna göre bir şey yapmaksa vardır. Bu sonuçlara bakarak asistanın varsayılan modelini değiştirdik: hız için tasarlanmış hafif modelden, hız–maliyet–kalite dengesi bu sınavda daha iyi çıkan modele geçtik. Ağır muhakeme isteyen işlerde ise puan tablosunun tepesindeki modeller devrede.
Sınavın bir de güzel sürprizi vardı: genel sıralamada ortalarda kalan en ekonomik model, dilekçe ve sözleşme üretimi bölümünde 7,7 ile birinci oldu. Bu bize şunu öğretti: "en iyi model" diye tek bir şey yok; işe göre en iyi model var. Ürünün işi de her görevi doğru modele yönlendirmek.
Bir şeffaflık notu: bu karne bizde durmuyor. OfisLex üyeleri, model puanlarını panel içindeki "YZ Model Karnesi" ekranından görebiliyor. Hangi modelin hangi işte nasıl performans gösterdiğini kullanıcıdan saklamanın bir anlamı yok — kararı birlikte verdiğimiz bir araçtan söz ediyoruz.
Sonuç: 6,4'lük stajyer, sıfır hatalı kâtip değil
Bu sınavdan çıkardığımız özet üç cümle:
1. Yapay zekâ, hukuk işinde ciddi zaman kazandıran ama tek başına güvenilmeyen bir yardımcı; en iyisi bile 10 üzerinden 6,4. 2. En büyük risk uydurma atıf — ve bu risk bizim ölçümümüzde de, dünyanın ölçümlerinde de her modelde var. Çözüm, aracı kaldırıp atmak değil; arşive karşı denetleyen, doğrulanamayanı yüzünüze söyleyen bir düzenek kurmak. 3. Sayısal işler modele değil, hesap araçlarına emanet edilir.
Bizim işimiz size "kusursuz yapay zekâ" satmak değil — öyle bir şey yok. Bizim işimiz, kusurları ölçülmüş, ölçüldüğü için de etrafına korkuluk örülmüş bir yardımcıyı masanıza koymak.
Merak ediyorsanız kendiniz sınayın: OfisLex'in yapay zekâ asistanını ücretsiz deneyebilirsiniz — üye olmadan 3 soru hakkınız var. Üye olduğunuzda da model karnesinin tamamı panelinizde sizi bekliyor.
*Bu yazı genel bilgilendirme amaçlıdır; hukuki tavsiye değildir. Yazıdaki puanlar 26.08.2026 tarihli iç değerlendirmemize aittir; modeller ve sonuçlar zamanla değişebilir.*
Yazıda anılan dış kaynaklar
- Dahl, Magesh, Suzgun & Ho, "Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models", *Journal of Legal Analysis* (2024) — arXiv sürümü
- Stanford RegLab/HAI, "Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools" — LawSites özeti
- Damien Charlotin, AI Hallucination Cases veritabanı
- Scientific American, "Why Lawyers Keep Citing Fake Cases Invented by AI"
- Vals AI, Vals Legal AI Report (VLAIR) ve VLAIR – Legal Research özeti
Dürüstlük güncellemesi (27 Ağustos)
Bu yazının ilk sürümünde sınavın "ürünün gerçek hattından, araçlar açıkken" koşulduğunu yazmıştık. Sonuçları didiklerken bir kurulum hatası bulduk: koşuyu başlatan betikteki bir bayrak eksiği yüzünden modeller sınava hesap ve arama araçları kapalıyken girmişti — yani tablo, asistanımızın elleri bağlı hâlini ölçüyordu. Bunu fark eder etmez üç şey yaptık: hatayı düzelttik, künye disiplinini sıkılaştıran istem iyileştirmelerini yayına aldık ve sınavın bir bölümünü bu kez gerçekten ürün yolundan yeniden koştuk.
Yeniden ölçümün sonucu: puanlar belirgin yükseldi. Örneğin günlük kullanımda önerdiğimiz model 30 sorunun tamamında 5,41'den 6,57'ye, sayısal hesap bölümünde 8,7'ye çıktı; en güçlü modelin ölçülen soruları 7,9 bandına yükseldi. Üyelerimizin gördüğü karne sayfası artık iki sütunlu: "araçsız ilk koşu" ve "ürün yolu" yan yana, hangi modelin hangisiyle ölçüldüğü açıkça yazılı.
Bunu neden anlatıyoruz? Çünkü bu yazının iddiası buydu: sonuçları — parlak olmayanlar ve kendi hatalarımız dahil — olduğu gibi paylaşmak. Yanlışı bulduk, ölçtük, düzelttik ve kaydını düştük.
Final: araçlı sınav tamamlandı — fark ölçüldü (27 Ağustos akşamı)
Yedi modelin tamamı aynı 30 soruya bu kez ürün yolundan (arşiv taraması + hesap araçları açık) yeniden girdi; puanlamayı yine aynı otomatik hakem yaptı. Sonuç tablosu artık üç sütunlu: modelin tek başına aldığı puan, OfisLex katmanıyla aldığı puan ve aradaki fark.
Ölçülen fark özetle şu: uydurma atıf etiketli cevap sayısı %37 düştü. En büyük sıçramayı en ekonomik modeller yaptı — biri +1,4, bugünkü varsayılan modelimiz +1,2 puan. Sayısal bölümde (faiz, harç, vekalet ücreti) araçlı ortalama 7,4'e çıktı; çünkü model rakamı ezberinden değil, güncel tarifeyle çalışan hesap motorundan alıyor. Zirve: en güçlü model + araçlar = 7,9/10.
Dürüstlük payı da yerinde: birkaç cevap, asistanın "emin değilsem soru sorarım" davranışına gitti ve tek atımlık sınav formatında düşük puan aldı — üründe bu bir hata değil, özelliktir; karnede ayrıca işaretlidir. Tam tablo, soru soru cevaplar ve puan gerekçeleri üyelerimize panelde açık.
Büronuzun tüm işleyişi tek platformda
UYAP & UETS aktarımı, otomatik süre takibi ve kaynak gösteren yapay zekâ asistanı — 14 gün ücretsiz, kredi kartı gerekmez.
Ücretsiz DeneyinDiğer yazılar
- Yapay Zekâ ile Dilekçe Hazırlarken Uydurma Karar Riski
- Rakamlarla Avukatlık 2026: Dört Resmî Tablo ve Büro Düzeninde Karşılığı
- Hukuk Bürosu Programı Nasıl Seçilir? 12 Kriterli Karar Rehberi
- UETS e-Tebligat: 5 Gün Kuralı ve Süre Başlangıcı Rehberi
- Adli Tatil 2026: Hangi Süreler İşler, Hangileri Uzar?
- Hukuk Yapay Zekâsına Doğru Soru Sorma Sanatı: Avukatlar için Prompt Rehberi
Yorumlar
Henüz yorum yok — ilk yorumu siz yazın.
OFİSLEX -