İşaret

2026-10-06 Yapay Zeka · Bilgisayarlı Görü · Doğal Dil İşleme · Robotik

Bugünkü sayıda dikkat çeken ortak ipucu, yapay zekanın artık yalnızca daha yetenekli olmakla değil, aynı zamanda daha hızlı ve daha sınanabilir olmakla da yarıştığı. Robot politikalarından uzun bağlam çıkarımına, değerlendirme kıyaslarından video akıl yürütmesine kadar her çalışma aynı soruyu soruyor: Bir modelin işe yaradığına nasıl güvenebiliriz ve bunun bedelini nasıl düşürürüz? Bu makaleleri bir arada okumak, verimlilik ve güvenilirliğin ayrı değil, birbirini besleyen iki hedef olduğunu gösteriyor.

vLLM v0.31.0: DeepSeek-V4.1-Flash'ta büyük performans artışı

vLLM v0.31.0, 307 katkıcıdan 717 commit ile DeepSeek-V4.1-Flash performansını ve hızlı yeniden başlatmayı öne çıkarıyor.

vLLM'in v0.31.0 sürümü, 307 katkıcının (96'sı yeni) 717 commit'iyle geldi. Öne çıkan başlık DeepSeek-V4.1-Flash performansı: NVFP4 sıkıştırılmış KV önbelleğiyle çalışan FlashMLA mega attention artık SM100 için varsayılan. İndeksleyici için DeepGEMM seyrek MQA logits'i, geçit GEMM'ini uzman seçimiyle birleştiren Mega-Gate, TP all-reduce ve MoE finalize füzyonları ile kodlayıcı CUDA grafikleri de pakette. Sürümün çalışma zamanı tarafındaki yenilikleri de dikkat çekiyor. vllm preload komutu ağırlık önbelleği daemon'unu başlatıyor; nicemlenmiş ağırlıklar motor yeniden başlatmalarında GPU belleğinde kalıyor, böylece her yeniden başlatmada ağırlıkları yeniden yükleme ve nicemleme maliyeti ortadan kalkıyor. Deneysel snapshot özelliği ise CRIU ile tam başlatılmış TP1 motorunu geri yüklüyor; soğuk başlatma süresi kısalıyor. Çıkarım tarafında Model Runner V2 üzerinde taslak model tabanlı spekülatif kod çözme, özel logits işlemcileri ve yeni LiLiCorr taslak modeli geldi. Geniş ölçekli servis için MoonEP all2all arka ucu, DeepEPv2 ve EPLB iyileştirmeleri de sürüme dahil edildi. Bu paket, büyük MoE modellerinin üretim ortamında hem daha hızlı çalışmasını hem de kesintiden sonra çok daha kısa sürede yeniden ayağa kalkmasını hedefliyor. vLLM, açık kaynak çıkarım altyapısında rekabeti hız ve operasyonel dayanıklılık eksenlerinde sürdürüyor.

vLLM Releases →

XiangqiBench: Hamleyi bulmak oyunu kazanmak değil

Çin satrancı kıyaslaması, LLM ajanlarının doğru hamleyi bilse bile oyunu bitirmekte zorlandığını gösteriyor.

XiangqiBench, dil modellerini statik hamle tahmini yerine kapalı döngüde, rakip karşılık verirken değerlendiren çalıştırılabilir bir kıyaslama. Motor veya yalnızca şah aramasıyla desteklenen zorunlu matlı 119 taktik oyun sonundan yola çıkan ajan, motor savunucuya karşı mat vermek zorunda. Hamle, durum sorgusu ve ileri simülasyonu ayıran etkileşimli bir REPL arayüzü kullanılıyor; iki gözlem protokolü altında 12 öncü LLM'den 8.568 çok turlu yörünge kaydedilmiş. Bulgular üç açığı ortaya koyuyor. Dönüşüm açığı: modeller referans ilk hamleyi denemelerin %26,1'inde oynuyor, ancak bunların yalnızca %13,9'u galibiyetle bitiyor. Tutarlılık açığı: lider model pass@3'te %38,7'ye ulaşsa da pass^3'te yalnızca %5,9'da kalıyor; yani model bir görevi bazen çözüyor ama güvenilir biçimde çözemiyor. Simülasyon açığı: kabul edilen simülasyon çağrılarının %32,3'ü geçersiz hamlede duruyor ve karşılaştırılabilir durumların %49,3'ünde gerçek savunucu, ajanın simüle ettiği hattan farklı yanıt veriyor. Bu sonuçlar, modellerin doğru fikri bulsa bile onu sonuca taşıyamadığını ve kendi simülasyonlarına gereğinden fazla güvendiğini gösteriyor. Çalışma, ajan değerlendirmelerinin kapsamın yanında güvenilirliği de raporlaması ve statik tahmin yerine kapalı döngü sonuçları ölçmesi gerektiğini savunuyor.

Arxiv CS.CL →

OpenRUA: Kodlama ajanları sıfır-atışlı robot politikası olabilir

Yalnızca ROS 2 terminal erişimiyle çalışan kodlama ajanı, özel altyapı olmadan robotu yüksek başarıyla kontrol ediyor.

OpenRUA, robot kontrolü için karmaşık özel çerçeveler kurmak yerine, hazır kodlama ajanlarına yalnızca robotun yerel yazılım arayüzü ROS 2'ye terminal erişimi veren sıfır-soyutlama bir çerçeve. Çalışma alanı tasarımı minimal: yalnızca ROS 2 belgeleri ve temel araçlar sunuluyor, iş akışını ajan kendisi örgütlüyor. Algılama dosya G/Ç'sine, manipülasyon ise kodlamaya indirgeniyor; yani ajan robotu, sıradan bir yazılım geliştirme görevi gibi kod yazarak yönetiyor. Claude Opus 5 ile çalışan Claude Code, CaP-Bench'te %99,0 ve LIBERO-PRO'da %87,0 başarı oranına ulaşıyor. Bu, hazır bir kodlama ajanının özel ilkeller veya göreve özgü eğitim olmadan sıfır-atışlı görsel-motor politika işlevi görebileceğini gösteriyor. Analiz, minimalist tasarımda ajanların ham sensör girdilerini işleyen programlar yazması gibi dikkat çekici ortaya çıkan davranışlar da sergilediğini ortaya koyuyor. Kamera görüntülerinden nesne konumu çıkaran ya da hareketleri adım adım doğrulayan küçük araçları kendiliğinden üretebiliyorlar. Bulgu, robot kullanımı için ağır çerçeve mühendisliğinin gerekliliğini sorguluyor ve mevcut olgun yazılım yığınlarının ajanlar için yeterli olabileceğini düşündürüyor. Böylece robotik uygulamaların geliştirme maliyeti ve giriş bariyeri düşebilir.

Hugging Face Daily Papers →

WAMJET: Dünya-Eylem Modellerini hızlandıran ajan çerçevesi

Kodlama ajanlarıyla WAM çıkarımını kayıpsız 9,95 kata kadar hızlandıran WAMJET, altı modelde test edildi.

Dünya-Eylem Modelleri (WAM), robot manipülasyonu için önceden eğitilmiş video temel modellerinden yararlanıyor; ancak büyük omurgaları ve video-eylem birlikte tahmini pahalı. Mevcut hızlandırma teknikleri çok, fakat her model ve donanım için doğru olanları seçip birleştirmek ciddi mühendislik gerektiriyor. WAMJET, kodlama ajanlarına yeniden kullanılabilir optimizasyon rehberi ile ölçüm ve doğrulama araçları veren bir ajan çerçevesi. Darboğaz odaklı iş akışında ajan çıkarımı profilliyor, hedefli kodu değiştiriyor, etkiyi doğruluyor ve darboğazlar kaydıkça hızlandırma yığınını yineleyerek iyileştiriyor; eylem kalitesi korunuyor. Her adımda yapılan değişikliğin gerçekten hız kazandırıp kazandırmadığı ölçülüyor, böylece körlemesine optimizasyon yerine ölçüm temelli bir ilerleme sağlanıyor. Deneyler altı WAM, üç kodlama ajanı ve iki GPU mimarisini kapsıyor. WAMJET, orijinal uygulamalara göre 9,95 kata kadar kayıpsız hızlanma sağlıyor. Yaklaşıklama ve donanım farkındalıklı optimizasyonlar karşılaştırılabilir başarı oranlarıyla gecikmeyi daha da düşürüyor. Sonuç, WAM dağıtımı için etkili hızlandırma yığınlarının büyük ölçüde otomatikleştirilebileceğini gösteriyor. Bu, pahalı uzman mühendislik emeğine duyulan ihtiyacı azaltarak video tabanlı robot politikalarının gerçek zamanlı kullanıma yaklaşmasına katkı sağlayabilir.

Arxiv CS.CV →

Fiziksel yapay zekada çıkarımı robot dışına taşımak

Microsoft Research: Çıkarımı kenar veya buluta aktarmak görev başarısını ve robotun pil ömrünü artırıyor.

Microsoft Research, fiziksel yapay zeka çıkarımının yalnızca robotun yerleşik GPU'sunda çalışması varsayımını sorguluyor. Temsili mobil manipülasyon iş yüklerinde çıkarımı kenar veya bulut GPU'larına aktarmak görev başarı oranlarını yükseltti, daha büyük yapay zeka modellerini mümkün kıldı ve dinamik ortamlara yanıtı iyileştirdi. Robotun üzerindeki donanımın sınırları, çalıştırılabilecek model boyutunu kısıtlıyordu; uzaktan çıkarım bu tavanı kaldırıyor. Güç tüketen yerleşik yapay zeka donanımını hafif bir yerleşik donanım ve uzaktan çıkarımla değiştirmek pil ömrünü de belirgin biçimde uzatıyor; robotlar şarjlar arasında daha uzun çalışabiliyor. Araştırmacılar ayrıca Physical AI Toolchain'e yeni bir yetenek ekledi: geliştiriciler robotik yapay zeka iş yüklerini robotlar, kenar altyapısı ve bulut arasında Kubernetes tabanlı araçlarla konteynerleştirip dağıtabiliyor ve orkestre edebiliyor. Bu yaklaşım, robot filolarının yönetimini bulut yazılımı dağıtımına benzer bir olgunluğa taşıyor. Bulgular, açık ve öngörülemez ortamlarda çalışan fiziksel yapay zekanın ölçeklenebilirliği için yerleşik hesaplamaya bağımlılığı azaltan dağıtık bir mimariyi işaret ediyor. Ağ gecikmesi ve bağlantı kesintileri ise bu modelin dikkatle ele alınması gereken yönü olmaya devam ediyor.

Microsoft Research Blog →

PerturBot: VLA modellerinde kısayol önyargılarını kırmak

Pertürbatif eğitim, görme-dil-eylem politikalarının görev kanıtı yerine kısayollara dayanmasını engellemeyi hedefliyor.

Bir görme-dil-eylem (VLA) politikası, eylemlerini belirlemesi gereken kanıtı yok sayarak karmaşık görevleri tamamlayabiliyor. Bilek kamerasına yakın tutulan bir nesne hedefi kaydırabiliyor; tanıdık bir isim, fiil değişse bile eğitimde eşleştiği işlemi tetikleyebiliyor; hiçbir şey tutmadan kapanan gripper yine de kaldırabiliyor. Çalışma bu davranışlara modalite kısayolları diyor. PerturBot, bu sorunu verinin tasarımı düzeyinde ele alıyor. Yöntem üç parçadan oluşuyor: görevi koruyan bilek görüşü pertürbasyonları uygulanıyor, talimatlar karar açısından ilgili açıklamalarla zenginleştiriliyor ve içerdikleri davranışla yeniden etiketlenmiş rastgele ve başarısız yörünge parçaları eklenerek eğitim verisi genişletiliyor. Çıkarım aşamasına dokunulmuyor; değişen yalnızca neyin ölçeklendiği. Yani yalnızca daha fazla veri toplamak yerine, verinin modeli hangi kanıta bakmaya zorladığı yeniden tasarlanıyor. Çalışma ayrıca bir politikanın kısayollara ne kadar bağımlı olduğunu çevrimdışı teşhis eden Grounding F-score ölçütünü öneriyor. Görev başarı oranı politikanın iyileşip iyileşmediğini gösterirken, Grounding F-score bu iyileşmenin sağlıklı olup olmadığını, yani politikanın kısayol yerine görev kanıtına dayanıp dayanmadığını ortaya koyuyor. İkili, VLA eğitimi için bir eğitim ve değerlendirme çerçevesi sunuyor ve robot politikalarında yüksek başarı oranının her zaman gerçek anlamayı yansıtmadığını hatırlatıyor. Özellikle ölçeklemenin tek başına yeterli olmadığını, verinin kalitesinin ve çeşitliliğinin de en az miktar kadar belirleyici olduğunu vurguluyor.

Hugging Face Daily Papers →

Doğrulanabilir ödüller video-dil modellerine zamanı öğretiyor mu?

Dört açık modelle yapılan çalışma, RLVR'nin kıyaslama doğruluğunu artırsa da zamansal sıralamayı öğretmediğini gösteriyor.

Doğrulanabilir ödüllerle pekiştirmeli öğrenme (RLVR), dil modellerinde büyük akıl yürütme kazanımları sağladı. Bu çalışma, RLVR'nin video-dil modellerine zaman hakkında ne öğrettiğini inceliyor. Dört açık model (Qwen3-VL-8B/4B, Qwen2.5-VL-7B, Gemma-3-12B), grup göreli politika optimizasyonuyla üç veri tarifiyle ince ayar yapıldı: doğrulanmış (sentetik CLEVRER), doğrulanmamış (43.751 gerçek web videosu üzerinde kendi kendine denetimli görevler) ve 1:1 karışım. Bulgular şöyle: Doğrulanmış eğitim alan içinde büyük kazanç sağlıyor; zayıf modellerde +14 ile +19 puan, en güçlüsünde +6. Ancak kazancın büyük kısmı görsel değil: kare olmadan doğruluk da neredeyse aynı ölçüde artıyor. Yani model, videoyu izlemeden de soru kalıplarından ipucu çıkararak iyileşiyor. Yalnızca doğrulanmış eğitim alan dışı doğruluğu ciddi biçimde düşürebiliyor; Qwen3-VL-8B iki gerçek video setinde 26,7 ve 25,2 puan kaybediyor. Gerçek video eklemek bu kaybı gideriyor. Üstelik 41 değerlendirmenin 39'unda sıralı ile karıştırılmış kareler arasındaki fark sıfırdan ayırt edilemiyor; modeller zamansal sırayı gerçekte kullanmıyor görünüyor. Yazarlar, kare olmayan kontrollerin raporlanmasını ve alan dışı bozulmaya karşı gerçek video karıştırılmasını öneriyor.

Arxiv CS.CV →

Periscope: Dondurulmuş dil modellerini bağlam penceresinin ötesine taşımak

Eğitimsiz Periscope, 27B bir modelin 4,5M token'lık bağlamları tek 80GB GPU'da okumasını sağlıyor.

Dil modelleri uzun metni tek ve ikinci dereceden maliyetli bir ileri geçişte okuyor, bağlam penceresinde duruyor ve ona ulaşmadan doğruluk kaybediyor. Periscope, sonlu bir küme üzerinde karar verilirken, yani hangi belgenin ilgili olduğu ya da hangi seçeneğin desteklendiği sorulduğunda, okumanın çarpanlara ayrılıp ayrılamayacağını soruyor. Eğitimsiz çıkarım yöntemi, metnin N parçasını K×K ızgaraya diziyor ve dondurulmuş modele aynı soruyu ardışık parçalardan oluşan K yerel aralık ile tüm metni örnekleyen K adımlı aralık hakkında soruyor. Her cevap en iyi yerel ve adımlı skorunu alıyor; parçaları iki aralığıyla puanlamak ek maliyetsiz bir kanıt haritası veriyor. LongBench v2'de haritanın en üst sıraladığı K parçayı okumak (9k token), aynı modelin 32k–1M token pencerelerdeki en iyi okumasıyla eşleşiyor. Medyan bağlamı 150k token olan InfiniteBench'te en iyi pencere okumasını 5 puan geride bırakıyor. Harita BRIGHT'ta da altı yöntem arasında en iyi NDCG@10'u veriyor. Her çağrı yalnızca bir yoklamayı önbelleğe aldığından, 27B bir model 4,5M token'lık bağlamları tek 80GB GPU'da okuyor; tek geçiş 296GB önbellek gerektirirdi.

Hugging Face Daily Papers →