Bu sayıda birbirinden farklı görünen araştırmalar, aslında tek bir soruya farklı açılardan yanıt arıyor: Yapay zeka sistemleri gerçek dünyayla nasıl daha sağlam bir bağ kurabilir? Hafıza yönetiminden robot hareketine, halüsinasyon tespitinden video üretimine uzanan bu çalışmalar, temsil kalitesini artırmanın güvenilirliği ve verimliliği eş zamanlı nasıl yükselttiğini gösteriyor. Başlıkları teker teker değil bir bütün olarak okuduğunuzda, alanın yalnızca performans değil zemin kazandığını fark edeceksiniz.
1.
Araştırma
ETA: Uzun Bağlamda KV Önbellek Darboğazına Öğrenilebilir Çözüm
Elastic Threshold Attention, 512K token uzunluğunda dizilerde FlashAttention-2'ye kıyasla 2,5 kat hızlanma sağlıyor.
Elastic Threshold Attention (ETA), büyük dil modellerinde uzun bağlam çözümlemesi sırasında ortaya çıkan KV önbellek bellek-bant genişliği darboğazını uçtan uca eğitilebilir dinamik eşiklerle çözen yeni bir mimari sunuyor. Mevcut seyrek dikkat yöntemleri sabit sezgisel kurallarla gereksiz bağlamı atarken kalite kaybına yol açıyor; ETA ise eşikleri doğrudan sorgu temsillerinden tahmin ederek zor çıkarım adımlarına yoğun bağlam ayırıyor, rutin token'ları ise budayabiliyor. Eğitim sırasında alt-eşik logit'leri sıfıra doğru çarpımsal olarak bastırarak temsil çöküşünü önlüyor ve dikkat lavabolarını ortadan kaldırıyor. 1,45 milyar parametreli ETA modeli yaklaşık yüzde 85 eğitim seyrekliği ve yüzde 38 aktif çözümleme yoğunluğuyla dil modellemesi, sağduyu akıl yürütme ve uzun bağlam iğne erişimi görevlerinde yoğun dikkatli modellerle rekabet ediyor. Triton'da yazılan özel çekirdek, KV bloklarını O(1) zamanda önbelleğe alınmış geometrik-olasılıksal sınırlarla tarayarak 512K token'a kadar FlashAttention-2'ye göre 2,5 kat gerçek süre hızlanması elde ediyor. Sonuçlar, üretim ortamında uzun bağlam çıkarımını hem hızlandırmak hem de kalite kaybı olmadan gerçekleştirmenin artık mümkün olduğunu gösteriyor.
Arxiv CS.LG →
Paylaş: X · LinkedIn
2.
Araştırma
VLA-Feedback: Robotlar için Gerçek Zamanlı Eylem Düzeltme
İki zaman ölçekli yeni mimari, dinamik görevlerde robot başarısını yüzde 27,5'ten yüzde 85'e taşıdı.
VLA-Feedback, Vision-Language-Action modellerindeki difüzyon tabanlı eylem üretiminin açık döngülü çalışmasından kaynaklanan tepkisizlik sorununu gerçek zamanlı geri bildirim mekanizmasıyla çözüyor. Mevcut VLA sistemleri, bir eylem parçasını tamamen gürültüden arındırdıktan sonra yürütmeye geçiyor; bu süreçte nesne hareket ederse ya da sahne değişirse model buna tepki veremiyor. Sorunun kökü, tüm difüzyon adımlarının tamamlanmasının ardından eylemin sahneden bağımsız biçimde uygulanmasında yatıyor. Önerilen iki zaman ölçekli mimari, düşük frekanslı difüzyon planlamasını yüksek frekanslı görsel geri bildirimle birleştiriyor: son gürültü giderme adımı hafif bir geri bildirim arayüzü olarak tutularak her eylem yürütülmeden önce en güncel gözlemle düzeltilebiliyor. Bu yaklaşım sayesinde tam görsel-dil difüzyon modeli yeniden çalıştırılmadan gerçek zamanlı eylem düzeltmesi mümkün hale geliyor; bu da hem hesaplama maliyetini düşürüyor hem de sistemin tepki hızını artırıyor. LIBERO simülasyonundaki statik görevlerde GR00T ile eşdeğer başarı elde eden sistem, dinamik görevlerde ortalama başarı oranını yüzde 27,5'ten yüzde 85'e çıkardı. Gerçek robot deneylerinde ise başarı oranı yüzde 51'den yüzde 73'e yükseldi. CoRL 2026'da sunulan bu çalışma, manipülasyon politikalarının değişen sahnelere uyum sağlama kapasitesini önemli ölçüde artırıyor ve kapalı döngülü robot kontrolü için pratik bir yol haritası sunuyor.
Arxiv CS.RO →
Paylaş: X · LinkedIn
3.
Araştırma
CHOREO: İnsansı Robot Becerilerini Ortak Yörüngeyle Birleştiriyor
CHOREO, farklı kaynaklardan gelen 2.950 beceriyi yeniden eğitmeden birleştirerek sekiz adımlı görevlerde yüzde 93,8 başarı elde etti.
CHOREO, pekiştirmeli öğrenme, hareket taklidi ve üretken modelleme gibi farklı yöntemlerle öğrenilmiş insansı robot becerilerinin birbiriyle uyumsuz temsilleri nedeniyle izole kaldığı sorununu eğitimsiz bir bileşim çerçevesiyle çözüyor. Temel gözlem şu: bir beceri nasıl öğrenilmiş olursa olsun, nihayetinde çalıştırılabilir bir hareket yörüngesi olarak ifade edilebilir. CHOREO bu fikir üzerine her beceriyi hareket durumları, temas bilgisi, anlamsal etiketler ve sınır koşullarını içeren SkillMotion adlı birleşik bir temsile dönüştürüyor. Böylece farklı kaynaklardan gelen beceriler ortak bir dilde ifade edilerek karşılaştırılabilir ve birleştirilebilir hale geliyor. Beceriler doğrudan devam, kübik Hermite harmanlama veya doğrulanmış köprü hareketleri aracılığıyla bileştiriliyor; kaynak modeller yeniden eğitilmiyor ya da test zamanında güncellenmesi gerekmiyor. Bu özellik, sistemi büyük ölçekli robot kütüphaneleri için son derece cazip kılıyor. MuJoCo'daki Unitree G1 üzerinde 2.950 SkillMotion varlığıyla yürütülen deneylerde 130 çok adımlı görevde yüzde 95,4 dizi başarısı elde edildi; sekiz eylemlik dizilerde bu oran yüzde 93,8 olarak gerçekleşti. Sonuçlar, çalıştırılabilir yörüngelerin önceden eğitilmiş insansı robot yeteneklerini biriktirmek ve birleştirmek için ölçeklenebilir, modüler bir arayüz sunduğunu ortaya koyuyor.
Arxiv CS.RO →
Paylaş: X · LinkedIn
4.
Araştırma
İleriye Bakan Bellek: Yapay Zeka Asistanları için Taahhüt Ledger'ı
Sıfır ek çıkarım maliyetiyle kişisel bellek erişimini taahhütlere göre önceliklendiren yöntem, zor görevlerde recall@5'i sıfırdan 0,955'e taşıdı.
Kişisel bellek erişimi geleneksel olarak geriye dönük çalışır: sorguya içerik olarak benzeyen öğeleri yüzeye çıkarır, ancak kullanıcının gelecekte yapmayı planladıklarından habersizdir. Bu çalışma, sorgu anında ek çıkarım maliyeti gerektirmeyen prospektif bir bellek erişim yöntemi tanımlıyor. Taahhütler, tarih veya tetikleyici koşullu girdiler olarak açık bir ledger'da tutuluyor; aktive olan bir taahhütle bağlantılı bellek öğeleri, embedding tabanlı erişimle çarpımsal olarak harmanlanarak önem artışı alıyor ve alaka düzeyi baskın olmaya devam ediyor. Yöntem bu sayede mevcut erişim altyapısına minimum müdahaleyle entegre edilebiliyor. TriggerBench'in yapısı temel alınarak hazırlanan sentetik bir değerlendirme setinde, 48 diyalog ve 175 görev üzerinde yapılan testlerde yöntem zor katmandaki recall@5 değerini 0,000'dan 0,955'e çıkardı; floor varyantıyla bu oran 1,000'e ulaştı. Çözümlenmiş 53 taahhüt görevi boyunca hiçbir yanlış artış gözlemlenmedi; bu da yöntemin hassasiyetini koruduğunu gösteriyor. Doğal dilde ifade edilen taahhüt-tetikleyici çiftlerinin yalnızca yüzde 17-29'unun embedding benzerliğini geçersiz kıldığını gösteren kapsam bulgusu, yaklaşımın geri kalan durumlara zarar vermediğini de doğruluyor. Bu çalışma, takvim ve görev yönetimi entegrasyonu gerektiren kişisel yapay zeka asistanları için hafif ve etkili bir temel sunuyor.
Arxiv CS.CL →
Paylaş: X · LinkedIn
5.
Araştırma
LLM Halüsinasyonları Dikkat Graflarının Topolojisinde Gizli
Forman-Ricci eğriliği analizi, halüsinasyonlu yanıtların dikkat graflarında bilgi akışı darboğazları oluşturduğunu ortaya koydu.
Bu çalışma, büyük dil modellerinde halüsinasyonlu ve halüsinasyonsuz yanıtları birbirinden ayırt etmek için dikkat graflarındaki bilgi akışı örüntülerinin topolojisini inceliyor. Araştırmacılar, dikkat graflarındaki yapısal darboğazları belirlemek amacıyla Forman-Ricci eğriliğini analiz etti; ardından dikkat başlıklarının hem yarı-yerel hem de küresel bilgi akışı özelliklerini yakalayan yeni bir yöntem geliştirdi. Forman-Ricci eğriliği, graflardaki kenar ağırlıklarını ve komşuluk yapısını dikkate alarak bilginin ne ölçüde serbestçe aktığını matematiksel olarak ölçmeye olanak tanıyor. Çeşitli LLM'ler ve yerleşik benchmark'lar üzerinde kapsamlı biçimde değerlendirilen tek geçişli yaklaşım, mevcut dikkat tabanlı ve çok yanıtlı baseline'ları iki halüsinasyon tespiti benchmark'ında tutarlı biçimde geride bırakırken farklı LLM mimarilerinde de rekabetçi performans gösterdi. Bulgular, halüsinasyonlu yanıtların token'lar arası bağlam paylaşımının bozulmasıyla güçlü biçimde ilişkili olduğunu ortaya koyuyor: bu yanıtlar özellikle son transformer katmanında aşırı öz-dikkat, erken token'lardan dağınık bağlam erişimi veya bilgi aşırı sıkışması ile karakterize ediliyor. Topolojik analizi halüsinasyon tespitine uygulayan bu yaklaşım, ek yanıt üretimi gerektirmeden tek geçişte çalışabilmesi sayesinde LLM güvenilirliği araştırmalarına hem yeni hem de yorumlanabilir ve verimli bir araç katıyor.
Arxiv CS.AI →
Paylaş: X · LinkedIn
6.
Araştırma
Üretken Videolarda Kamera Hareketi İntihalini Tespit Eden İlk Benchmark
Yeni yöntem, kamera hareketi intihal tespitinde en güçlü baseline'a göre 3 kattan fazla iyileşme sağladı.
Üretken video modelleri, basit metin istemleriyle profesyonel ekipman gerektiren özgün kamera hareketlerini kolaylıkla taklit edebiliyor; ancak mevcut benzerlik tespit yöntemleri görsel içeriğe odaklandığından bu tür derin hareket benzerliğini yakalayamıyor. Bu durum, video üretim endüstrisinde telif hakkı ihlallerinin tespitini giderek zorlaştırıyor. Bu çalışma, kamera hareketi analizine odaklanan ilk benchmark'ı sunuyor: 11 farklı hareket stili ve değerlendirme protokollerini kapsayan kapsamlı bir veri seti oluşturuldu. Optik akışın karmaşık hareket tespitindeki yetersizliğini gidermek için akışkanlar dinamiğinden esinlenerek girdap (vorticity) ipuçlarıyla zenginleştirilmiş yeni bir hareket temsili öneriliyor. Girdap tabanlı temsil, döngüsel ve kıvrımlı kamera hareketlerini doğrusal akışın kaçırdığı ayrıntılarla birlikte kodlayabiliyor. Geliştirilen dedektör, intihal tespitinde en güçlü baseline'a göre 3,02 kat iyileşme elde etti ve üretken videolar üzerinde de etkinliğini korudu. ACM Multimedia 2026'da sözlü sunum olarak kabul edilen çalışma, telif hakkı korumasını statik görsel içeriğin ötesine taşıyarak dinamik kamera hareketini de kapsama alıyor. Bu gelişme, yapay zeka destekli video üretiminin yaygınlaştığı bir dönemde fikri mülkiyet tartışmalarını yeniden şekillendirebilir ve içerik üreticileri için yeni bir koruma katmanı sağlayabilir.
Arxiv CS.CV →
Paylaş: X · LinkedIn
7.
Araştırma
GAM: Robot Temel Modellerine 3B Metrik Konumlandırma Temeli
Grounded Action Model, 3B nesne konumlandırmayı açık bir temel alarak LIBERO-PRO benchmark'ında yüzde 61 başarı oranıyla yeni rekor kırdı.
Mevcut robot temel modelleri—VLA'lar ve dünya-eylem modelleri (WAM'lar)—nesnelerin 3B metrik konumlarını robot demonstrasyonlarından örtük olarak öğreniyor; bu durum modellerin yeni sahnelere ve nesne düzenlemelerine genelleme kapasitesini kısıtlıyor. Grounded Action Models (GAM), 3B konumlandırmayı örtük bir yan ürün olmaktan çıkarıp açık bir temel bileşen olarak mimarinin merkezine yerleştiriyor. GAM; dil, nokta veya kutu istemleriyle koşullandırılabiliyor. Bu istemler önce seçili nesnelerin hedef odaklı görsel özelliklerini ve metrik geometrisini birleştiren nesne-merkezli bir temsile dönüştürülüyor. Söz konusu temsil, robot durum geçmişiyle çok akışlı bir transformer aracılığıyla harmanlarak eylem parçaları tahmin ediliyor. Böylece model, sahne içindeki nesnelerin tam konumsal bilgisine dayalı kararlar alabiliyor. RoboTwin 2.0 benchmark'ında 50 görevde ortalama yüzde 55,3 başarı elde eden GAM, sahne rastgeleleştirmesi altında rakiplerine yüzde 17 puan fark atarak öne çıktı. LIBERO-PRO'da 16 pertürbasyon ayarında yüzde 61 ortalama başarıyla en iyi performansı gösterdi; özellikle nesnelerin yeri değiştirildiğinde ya da yeniden atandığında kazanımlar belirginleşti. Sonuçlar, açık 3B konumlandırmanın robot politikalarını daha sağlam ve uzun ufuklu görevlere uygun hale getirdiğini somut biçimde doğruluyor.
Hugging Face Daily Papers →
Paylaş: X · LinkedIn
8.
Araştırma
Akışlı Video Difüzyonu: Bağlam, Zamanlama ve Eğitim Yeniden Ele Alındı
Progresif geçmiş koşullandırması, tam gürültüsü giderilmiş geçmişe gerek kalmadan DiT'te 2,83 kata varan hızlanma sağlıyor.
Akışlı video difüzyon modellerinin tasarım uzayını sistematik biçimde ele alan bu çalışma, model ve örnekleyici seçimlerini, geçmiş koşullandırma politikalarını, yürütme zamanlamasını ve eğitim stratejilerini birleştiren analitik bir çerçeve sunuyor. Çerçeve, nedensel bağlam seçim politikalarının geniş bir ailesini barındırıyor ve hesaplama bağımlılıkları ile eğitim-çıkarım hizalamasını açık hale getiriyor. Böylece araştırmacılar farklı politika seçimlerinin uzun video tutarlılığı ve hesaplama verimliliği üzerindeki etkisini doğrudan karşılaştırabiliyor. VBench prompt seti üzerinde üç temsili politika karşılaştırıldı: aynı düzey ve progresif geçmiş politikaları sırasıyla 85,24 ve 85,60 puanla temiz geçmiş referansının (84,45) üzerine çıktı. Uzun video karşılaştırmaları da progresif geçmişin özne tutarlılığını ve hareket uyumunu iyileştirdiğini ortaya koydu. Progresif geçmiş ardışık düzeni, birden fazla gürültü giderme düğümünün birlikte işlenmesiyle değerlendirilen koşullar altında DiT'te 1,57 ila 2,83 kat kararlı durum hızlanması elde etti. Ayrıca DMD sahte-skor ağına uygulanan LoRA adaptasyonu, tam parametre adaptasyonuna kıyasla yalnızca yüzde 2,15 eğitilebilir parametre kullanarak üretim kalitesini artırdı. Bu bulgular, yüksek kaliteli akışlı video üretimi için tam gürültüsü giderilmiş geçmişin zorunlu olmadığını gösteriyor ve daha verimli video üretim sistemlerinin önünü açıyor.
Arxiv CS.CV →
Paylaş: X · LinkedIn