NVIDIA’nın geliştirdiği AVO kodlama ajanı, ARC-AGI-3 değerlendirmesinin herkese açık veri kümesinde yer alan 25 oyundaki 183 seviyenin tamamını çözerek yüzde 100 puan aldı. Wccftech’in aktardığına göre ajan, görevlerin kuralları veya ulaşması gereken hedefler önceden açıklanmadan deneme, sonuçları gözlemleme ve hatalarını düzeltme yöntemiyle ilerledi.
AVO’nun temelinde Anthropic’in Claude Opus 5 modeli bulunuyor. Ancak aynı herkese açık testte Claude Opus 5 tek başına yüzde 30 puan alırken, NVIDIA’nın modelin çevresine kurduğu ajan sistemi yüzde 100 başarıya ulaştı. Sonuçlar, yapay zekâ modelinin kendisi kadar modeli dış dünyaya bağlayan ve çalışma biçimini düzenleyen yazılım katmanının da performans üzerinde belirleyici olabileceğini gösterdi.
Yapay zekâ harness sistemi ne işe yarıyor?
Yapay zekâ alanında “harness”, bir modelin çevresine yerleştirilen harici yazılım katmanını ifade ediyor. Model temel akıl yürütme işlevini sağlarken bu katman; internet sayfasını görüntüleme, dosyalarla çalışma veya Python betiği çalıştırma gibi araçlara erişimi mümkün kılıyor. Böylece genel amaçlı bir metin tahmin modeli, farklı araçları kullanabilen bir problem çözücüye dönüşüyor.
Bu yapı aynı zamanda modele deneme-yanılmaya dayalı, kendi kendini düzelten bir çalışma döngüsü kazandırıyor. Her girişimin sonucu yeniden modele iletiliyor ve sonraki adım bu geri bildirim doğrultusunda belirleniyor. Harness ayrıca başarılı kod parçalarını saklıyor, işe yaramayan hata kayıtlarını ayıklıyor ve ilerlemenin düzenli bir kaydını tutuyor. Bağlam uzadığında önceki ayrıntıları unutabilen model, bu harici hafıza sayesinde çözüm sürecindeki önemli bilgileri koruyabiliyor. İstemlerin ve kısıtlamaların belirli kurallara göre yapılandırılması da bu katmanın görevleri arasında bulunuyor.
CUDA için geliştirilen ajan farklı bir göreve uyarlandı
NVIDIA, AVO’yu başlangıçta CUDA GPU çekirdeklerini optimize etmek amacıyla hazırladı. Ajan yedi gün boyunca otonom biçimde çalıştı, 500’den fazla farklı yaklaşımı inceledi ve FlashAttention-4’ten yüzde 10,5’e kadar daha yüksek performans gösteren çekirdekler üretti.
Şirket daha sonra temel ajan mimarisini değiştirmeden GPU mühendisliğinde kullanılan araçları ARC-AGI-3 görev arayüzüyle değiştirdi. Kod inceleme, sonuçları hatırlama ve hataları düzelterek yeniden deneme yetenekleri bu kez görsel ve etkileşimli mantık bulmacalarına aktarıldı. AVO, önceki çalışma alanıyla ilgisi bulunmayan testteki 183 seviyeyi herhangi bir başlangıç talimatı veya tanımlanmış hedef olmadan tamamladı.
NVIDIA’nın paylaştığı verilere göre AVO bütün seviyeleri toplam 6 bin 624 eylemle çözdü. VISTA gibi diğer önde gelen ajan katmanları aynı herkese açık bölümü tamamlamak için 7 bin 542 eyleme ihtiyaç duydu. Bu karşılaştırma AVO için yüzde 12’lik verimlilik artışına işaret etti.
Bununla birlikte sonuçlar yalnızca ARC-AGI-3’ün herkese açık veri kümesini kapsıyor. Değerlendirme platformu, özel olarak geliştirilmiş harici ajan katmanlarının gizli test kümesinde çalıştırılmasına şu anda izin vermiyor. Bu nedenle AVO’nun açıklanmayan ve daha belirleyici kabul edilen özel görevlerde nasıl bir performans göstereceği bilinmiyor.
Kaynak: Wccftech








