ChatGPT, Gemini ve Claude, yapay zeka nedeniyle mesleklerin ortadan kalkmasıyla ilgili değerlendirmeleri yaydı; bilim insanları ise bunların güvenilirliğinden şüpheleniyor.
Ana Araştırma Fikri
Kuzeybatı Üniversitesi ve Amerikan Üniversitesi ekonomistleri, üç en büyük dil yapay zeka modeli (ChatGPT‑5, Gemini 2.5 ve Claude 4.5) otomasyon riskinde olan mesleklerin farklı değerlendirmelerini yaptığını ortaya koydu. Bu durum, politika yapıcılar ve işverenler tarafından geleceğin iş piyasasını planlarken kullanılan “AI duyarlılık endeksleri”nin güvenilirliğini sorguluyor.
1. Araştırma Nasıl Yapıldı
Adım Ne Yaptık Görev Tanımı Modellerden AI karşısında mesleklerin savunmasızlığını değerlendirmeleri istendi. Yanıtların Karşılaştırılması Değerlendirmeler birbirleriyle ve gerçek verilerle eşleştirildi. Farklılıkların Nedenleri Analizi İki ana faktör belirlendi: modeller arasındaki farklılıklar ve AI’yi zaten kullanan uzmanların etkisi.
2. Sonuçlar
Meslek Claude 4.5 Gemini 2.5 ChatGPT‑5
Muhasebeci Yüksek savunmasızlık Düşük Ortalama
Reklam Müdürü — Üst düzey yöneticiler —
* Çelişkiler
- Claude, muhasebecileri en yüksek riskli olarak sınıflandırırken Gemini çok daha düşük bir risk gösterdi.
- Reklam müdürleri ve üst düzey yöneticilerin değerlendirmeleri de farklılık gösterdi.
- ChatGPT ve Gemini neredeyse %75 durumda aynı sonuçları verdi, ancak yaklaşık dörtte biri farklıydı.
* “AI Kullanıcılarının” Etkisi
Finansal analistler, gelecekteki modellerin eğitildiği verileri üreterek sinir ağlarıyla yoğun olarak çalışıyor. Bu durum değerlendirmeleri kaydırarak AI ile zaten yakından ilişkili meslekleri modellerin gözünde daha savunmasız gösteriyor.
3. Duyarlılık Endeksleri Nasıl Oluşturulur
1. El ile – uzmanlar AI’nin belirli görevler üzerindeki etkisini değerlendirir.
2. Kullanıcı anketleri – platformu zaten kullananların görüşlerini toplar.
3. En büyük dil modelleri (LLM) – otomatik olarak değerlendirmeler üretir.
* Sorunlar:*
- El ile yöntem öznel olma eğilimindedir.
- Anketler tek bir platformla sınırlı kalır ve tüm piyasayı yansıtmaz.
Bununla birlikte bu endeksler analitik raporlar, danışmanlık ve politika yapımında yaygın olarak kullanılmaktadır.
4. Uygulama İçin Ne Demek
* Değerlendirmelerin güvenilirliği henüz bilinmiyor; LLM’lerin uzman yöntemlere kıyasla daha doğru tahminler sunup sunmadığı net değil.
* Tek bir göstergeye dayalı karar riskini yazarlar uyarıyor: politika yapıcılar ve işverenler tek sayısal değere aşırı güvenebilir.
5. Araştırmacıların Önerileri
1. Birden fazla AI modelini aynı anda kullanın, tek bir modeli değil.
2. Sonuçlardaki belirsizlik seviyesini açıkça belirtin.
3. Gerçek kullanıcı anketleriyle bulguları doğrulayarak AI’nin gerçekten nasıl uygulandığını ve hangi görevleri yerine getirdiğini anlayın.
> “Kişisel olarak, iş değişikliği veya uzmanlık seçimi gibi kararlar için tek bir göstergeye güvenmemeyi tercih ederim,” diyor Michelle Yin.
Sonuç:
Mevcut AI duyarlılık endeksleri daha eleştirel bir yaklaşıma ihtiyaç duyuyor. Birden fazla modelin ve ampirik verilerin kombinasyonu, tahminlerin güvenilirliğini artırarak tek taraflı değerlere dayalı hatalı kararların önlenmesine yardımcı olabilir.
Yorumlar (0)
Düşüncenizi paylaşın — lütfen kibar olun ve konu dışına çıkmayın.
Yorum yapmak için giriş yapın