Microsoft araştırmacıları, yapay zeka modellerinin henüz karmaşık görevleri çözme yeteneğine sahip olmadığını belirtiyor
Microsoft araştırmacıları, modern büyük dil modellerinin (LLM) karmaşık çok adımlı görevleri yerine getirirken karşılaştığı sınırlamaları ortaya çıkardı
Deneyler kapsamında Microsoft Research, en gelişmiş yapay zeka modellerinin bile uzun ve çok aşamalı işlemleri üstlenmeleri durumunda ciddi hatalar yaptığını belirledi. Test edilen sistemler arasında Gemini 3.1 Pro, Claude 4.6 Opus ve GPT 5.4 bulunuyordu; ortalama olarak her biri bağımsız işleme sonrasında belgelerin yaklaşık %25’ini kaybetti.
Ne test edildi
* DELEGATE‑52 Benchmark
Philip Laban, Tobias Schnabel ve Jennifer Neville tarafından oluşturuldu. 52 profesyonel alandaki iş akışlarını modelleyerek programlama ve nota yazımından kristalografiye kadar geniş bir yelpazeyi kapsar.
* Değerlendirme Kriteri
Modeller, belgelerin bütünlüğünü 20 işlem döngüsünden sonra ne ölçüde koruduklarıyla değerlendirildi. “Hazırlık” eşiği %98 olarak belirlendi – sonuç bu değerin altına düşerse görev başarısız sayıldı.
Ana Bulgular
Alan En İyi Sonuçlar Programlama En Güçlü Performans Doğal Dil En Az Güvenilir Modeller
* Kalite Düşüşü
Belgelerin %80’inden fazla kombinasyonunda kalite %80’e ve altına geriledi. En iyi model (Gemini 3.1 Pro), sadece 52 alanın 11’inde hazırlık kriterlerini karşıladı.
* Atlama Hataları
Kayıplar kademeli değil, “atlamalar” şeklindeydi: tek bir etkileşim döngüsünde model %10 ila %30 arasında doğruluk kaybedebiliyordu. Daha gelişmiş modeller (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) küçük hatalardan kaçınarak bunları sonraki aşamalara erteleyerek etkileşim sayısını azalttı.
* Ajans Yönetimi
Ajans yönetim modunda araç kullanıldığında sonuçlar iyileşmedi: döngünün sonunda kalite yaklaşık %6 düşüyordu.
Kullanıcılar için Ne Anlama Geliyor
Bilim insanları, kullanıcıların yapay zeka sistemlerini yetki verirken hâlâ dikkatli bir şekilde kontrol etmeleri gerektiğini vurguluyor. Mevcut modeller yalnızca dar alanlarda bağımsız çalışabiliyor.
Bununla birlikte benchmark yazarları belirgin ilerleme kaydedildiğini söylüyor: OpenAI ailesi 16 ay içinde performansını %14,7’den %71,5’e yükseltti. Bu, LLM’lerin gelişmeye devam ettiğini ancak hâlâ karmaşık çok adımlı görevlerde sınırlı kaldığını doğruluyor.
Yorumlar (0)
Düşüncenizi paylaşın — lütfen kibar olun ve konu dışına çıkmayın.
Yorum yapmak için giriş yapın