Microsoft araştırmacıları, yapay zeka modellerinin henüz karmaşık görevleri çözme yeteneğine sahip olmadığını belirtiyor

Microsoft araştırmacıları, yapay zeka modellerinin henüz karmaşık görevleri çözme yeteneğine sahip olmadığını belirtiyor

18 hardware

Microsoft araştırmacıları, modern büyük dil modellerinin (LLM) karmaşık çok adımlı görevleri yerine getirirken karşılaştığı sınırlamaları ortaya çıkardı

Deneyler kapsamında Microsoft Research, en gelişmiş yapay zeka modellerinin bile uzun ve çok aşamalı işlemleri üstlenmeleri durumunda ciddi hatalar yaptığını belirledi. Test edilen sistemler arasında Gemini 3.1 Pro, Claude 4.6 Opus ve GPT 5.4 bulunuyordu; ortalama olarak her biri bağımsız işleme sonrasında belgelerin yaklaşık %25’ini kaybetti.

Ne test edildi
* DELEGATE‑52 Benchmark

Philip Laban, Tobias Schnabel ve Jennifer Neville tarafından oluşturuldu. 52 profesyonel alandaki iş akışlarını modelleyerek programlama ve nota yazımından kristalografiye kadar geniş bir yelpazeyi kapsar.

* Değerlendirme Kriteri

Modeller, belgelerin bütünlüğünü 20 işlem döngüsünden sonra ne ölçüde koruduklarıyla değerlendirildi. “Hazırlık” eşiği %98 olarak belirlendi – sonuç bu değerin altına düşerse görev başarısız sayıldı.

Ana Bulgular
Alan En İyi Sonuçlar Programlama En Güçlü Performans Doğal Dil En Az Güvenilir Modeller
* Kalite Düşüşü

Belgelerin %80’inden fazla kombinasyonunda kalite %80’e ve altına geriledi. En iyi model (Gemini 3.1 Pro), sadece 52 alanın 11’inde hazırlık kriterlerini karşıladı.

* Atlama Hataları

Kayıplar kademeli değil, “atlamalar” şeklindeydi: tek bir etkileşim döngüsünde model %10 ila %30 arasında doğruluk kaybedebiliyordu. Daha gelişmiş modeller (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) küçük hatalardan kaçınarak bunları sonraki aşamalara erteleyerek etkileşim sayısını azalttı.

* Ajans Yönetimi

Ajans yönetim modunda araç kullanıldığında sonuçlar iyileşmedi: döngünün sonunda kalite yaklaşık %6 düşüyordu.

Kullanıcılar için Ne Anlama Geliyor
Bilim insanları, kullanıcıların yapay zeka sistemlerini yetki verirken hâlâ dikkatli bir şekilde kontrol etmeleri gerektiğini vurguluyor. Mevcut modeller yalnızca dar alanlarda bağımsız çalışabiliyor.

Bununla birlikte benchmark yazarları belirgin ilerleme kaydedildiğini söylüyor: OpenAI ailesi 16 ay içinde performansını %14,7’den %71,5’e yükseltti. Bu, LLM’lerin gelişmeye devam ettiğini ancak hâlâ karmaşık çok adımlı görevlerde sınırlı kaldığını doğruluyor.

Yorumlar (0)

Düşüncenizi paylaşın — lütfen kibar olun ve konu dışına çıkmayın.

Henüz yorum yok. Yorum bırakın ve düşüncenizi paylaşın!

Yorum bırakmak için lütfen giriş yapın.

Yorum yapmak için giriş yapın