İşaret

2026-10-01 Yapay Zeka · Bilgisayarlı Görü · Doğal Dil İşleme · Robotik

Bu sayı, yapay zekanın çevre anlama ve eyleme dönüştürme döngüsünü her katmanda—görüden sese, robotik planlamadan insan-makine diyaloğuna—nasıl derinleştirdiğini mercek altına alıyor. Bilineer dünya modellerinden düşük ranklı politika güncellemelerine uzanan araştırmalar, verimliliğin artık ham hesaplama gücünden değil yapısal içgörüden geldiğini gösteriyor. Bir arada okunduğunda bu çalışmalar, erişilebilirlik ve kapsayıcılığı temel tasarım kısıtı olarak benimseyen yeni bir robotik ve yapay zeka mimarisinin ana hatlarını çiziyor.

Bilineer Dünya Modelleri Robotikte Planlamayı Hızlandırıyor

JEPA tarzı bilineer dünya modeli, planlamayı neredeyse bin kat hızlandırırken kontrol doğruluğunu koruyabiliyor.

Üç panelli grafik: PCA bileşen varyansı (kırmızı kesik çizgiyle eylem boyutu), fiziksel durum değişkenleri ile gizli uzay…
Öğrenilen gizil temsillerin geometrisi, bilineer modelin fiziksel durum değişkenlerini anlamlı biçimde kodladığını ortaya koyuyor. Görsel: Pariente ve ark., arXiv, CC BY 4.0 · kaynak · CC BY 4.0

Araştırmacılar, gizli dinamikleri bilineer bir parametrizasyonla kısıtlayan JEPA tarzı bir dünya modeli önerdi. Mevcut dünya modelleri, yüksek boyutlu gözlemlerin eylemler altında nasıl evrildiğini tahmin etmek için rastgele gizli dinamikler öğrenir; bu yaklaşım ise modelleme yükünü kodlayıcıya kaydırarak sistemin kontrol edilebilir geometrisini açığa çıkaran daha zengin temsiller üretmesini teşvik ediyor. Bilineer yapı, eylem kurtarılabilirliğini yapısal olarak zorunlu kılarak temsil çöküşünü tasarım gereği önlüyor. Kısıtlayıcı görünse de bu parametrizasyonun geniş bir doğrusal olmayan dinamik sistemler sınıfına uygulanabildiği matematiksel olarak gösterildi. Standart 2B ve 3B kontrol görevlerinde yürütülen deneyler, önerilen modelin planlama süresini neredeyse üç kat büyüklük mertebesinde azalttığını, bununla birlikte kontrol doğruluğunu koruyup hatta iyileştirebildiğini ortaya koyuyor. Uzun ufuklu planlama ve gerçek zamanlı kontrol senaryolarında da başarılı sonuçlar elde eden bu yöntem, JEPA tarzı dünya modellerini kısa ufuklu çevrimdışı planlamanın ötesine taşıyor. Geleneksel yaklaşımlarda kodlayıcı ve dinamik modeli ayrı ayrı optimize edilirken bu çalışmada ikisi arasındaki görev dağılımı yeniden tanımlanarak sistemin bütünü daha verimli hale getiriliyor. Özellikle robotik uygulamalarda hesaplama bütçesinin kısıtlı olduğu gerçek zamanlı senaryolarda bu hız kazanımı kritik bir avantaj sunuyor. Sonuç olarak çalışma, yapısal kısıtlamaların bir dezavantaj değil, hem verimlilik hem de yorumlanabilirlik açısından güçlü bir tasarım ilkesi olabileceğini somut biçimde kanıtlıyor.

Arxiv CS.RO →

Fiatlux: İnsansı Robotlar İçin Ampul Değiştirme Benchmark'ı

Fiatlux, insansı robotların merdiven tırmanıp ampul değiştirmesini tek bir uzun ufuklu bölümde değerlendiren ilk benchmark.

NVIDIA Isaac Lab üzerine inşa edilen Fiatlux, insansı robotların dikey hareketlilik ve hassas manipülasyonu aynı anda sergilemesini gerektiren yeni bir kıyaslama ortamı sunuyor. Mevcut benchmark'lar masa üstü manipülasyon, düz zemin ev aktiviteleri ya da insansı lokomotion ve manipülasyonu ayrı ayrı değerlendirirken Fiatlux, bu yetenekleri tek bir uzun ufuklu bölümde birleştiriyor. Unitree G1 insansı robotunun tavana ya da duvara monte bir armatürün altına merdiven yerleştirmesi, merdivenle tırmanması, eski ampulü yenisiyle değiştirmesi ve eskisini bertaraf kutusuna bırakması bekleniyor; tüm bu adımlar zorluk ağırlıklı kapılar üzerinden puanlanıyor. Kırılganlık sınırını aşan ya da ampul düşüren denemeler kısmi puan alabiliyor. Sistem, fiziksel robotun ölçebileceği sinyallere dayanan standart mod ile tam simülatör durumuna erişim sağlayan ayrıcalıklı mod olmak üzere iki gözlem türü sunuyor. RSL-RL PPO, sıfır-atış NVIDIA GR00T N1.7 VLA modelleri ve tüm gövde kontrolcülerini kapsayan referans başlangıç uygulamaları da kamuya açık şekilde paylaşılıyor. Fiatlux, gerçek dünya koşullarına yakın senaryolarda insansı robot politikalarının bütünsel değerlendirmesi için kritik bir araç niteliği taşıyor.

Arxiv CS.RO →

FD-VAD: Ses Diyaloglarında Anlamsal Tur Sonu Tespiti

FD-VAD, ASR gerektirmeden akış halindeki sesten konuşma turunu bitirip bitirmediğini anlamsal olarak belirliyor.

Tam çift yönlü (full-duplex) ses etkileşimlerinde doğal tur alma, kısmi konuşmadan bir duraksamanın tereddütten mi yoksa tamamlanmış bir konuşma niyetinden mi kaynaklandığını belirlemeyi gerektiriyor. Mevcut akustik ses aktivite algılama sistemleri bu anlamsal bağlamdan yoksunken basamaklı ASR tabanlı yaklaşımlar ek gecikme ve transkripsiyon bağımlılığı yaratıyor. FD-VAD, bu problemi nedensel bir ses-dil akıl yürütme görevi olarak formüle ederek ASR gerektirmeden akış halindeki sesi doğrudan Continue/Stop kararlarına eşleyen hafif bir mimari öneriyor. Dondurulmuş bir konuşma kodlayıcı, hafif bir modalite adaptörü ve parametre-verimli ince ayar yapılmış bir dil modelini birleştiren sistem; belirsiz tur sınırlarını iyileştirmek için güven kapılı taahhüt mekanizması ve sert-negatif örnekleme stratejileri de içeriyor. TurnBench geliştirme kümesinde sıfır-atış ayarında 0.853 EOT recall değerine ulaşan FD-VAD, hem alan içi hem de konuşma temelli değerlendirmelerde güçlü rakipleri geride bırakıyor. Sonuçlar, ara ASR veya diyalog durum takibi olmaksızın doğrudan akış sesinden anlamsal uç nokta tespitinin mümkün olduğunu kanıtlıyor; bu da gerçek zamanlı sesli diyalog sistemlerinin tasarımında önemli bir adım anlamına geliyor.

Arxiv CS.CL →

BIND: Robot Eylemlerini 2B Görüntü Özelliklerine Bağlıyor

BIND, yalnızca 5 demonstrasyonla neredeyse mükemmel başarı oranı yakalayan veri-verimli bir robot eylem temsili sunuyor.

BIND, görü-motor robot politikaları için 3B robot eylemlerini karşılık gelen 2B görüntü özelliklerine bağlayan yeni bir eylem temsili yaklaşımı sunuyor. Mevcut politika mimarilerinde eylem kafaları genellikle önceden eğitilmiş bir görü kodlayıcısının ürettiği tek bir global özellik vektöründen MLP regresyonu olarak biçimlendiriliyor; bu da ağın demonstrasyonlardan hedef eylemler ile yansıtıldıkları görüntü özellikleri arasındaki ilişkiyi sıfırdan öğrenmesini zorunlu kılıyor. BIND bu boşluğu, aday uç efektör konumları için oluşturulan 3B noktaları her kamera görünümündeki 2B projeksiyonlarıyla ilişkilendirerek ve kamera geometrisi aracılığıyla eylem-özellik bağını yapısal biçimde kurarak kapatıyor. Bu sayede model, görsel temsili ve eylem tahminini birbirinden bağımsız değil, geometrik olarak tutarlı bir çerçeve içinde öğreniyor. Gerçek robot deneyleri, yöntemin yalnızca 5 demonstrasyonla görevlerde neredeyse mükemmel başarı oranına ulaştığını gösteriyor. Koordinat regresyonuna dayalı temel yöntemlerin tamamen başarısız olduğu kamera açısı değişimleri ile görülmemiş nesne konumlarında dahi BIND düzgün biçimde bozulma sergileyerek sağlamlığını ortaya koyuyor. Önceden eğitilmiş görsel özelliklerin doğrudan eylem kararlarına bağlanması, veri verimliliğini önemli ölçüde artırırken genelleme kapasitesini de güçlendiriyor. BIND, özellikle az veriyle öğrenme ve dağılım dışı sağlamlık gerektiren gerçek dünya robot uygulamaları açısından pratik ve ölçeklenebilir bir değer taşıyor.

Arxiv CS.RO →

VLA Modelleri RL Sonrası Düşük Ranklı Güncelleme Yapısı Kazanıyor

RL ile ince ayar yapılan VLA modellerinde ağırlık güncellemeleri düşük ranklı ve belirli modüllere yoğunlaşmış oluyor.

İki çubuk/ısı haritası grafiği: Solda BC ve RL kontrol noktaları için güncelleme yoğunluğu, sağda modül bazında efektif…
RL ile ince ayar yapılan π₀.₅ modelinde ağırlık güncellemeleri, özellikle Timestep modüllerinde yoğunlaşırken düşük ranklı bir yapı sergiliyor. Görsel: Oh ve ark., arXiv, CC BY 4.0 · kaynak · CC BY 4.0

Pekiştirmeli öğrenme (RL), Görü-Dil-Eylem (VLA) modellerini ince ayar yapmak için giderek daha fazla kullanılıyor; ancak RL'nin bu politikaları içsel olarak nasıl yeniden biçimlendirdiği bugüne dek yeterince anlaşılamamıştı. Yeni çalışma, π₀.₅ ve GR00T N1.5/N1.6 dahil yaygın kullanılan akış tabanlı VLA modellerinde RL eğitiminin belirgin biçimde düşük ranklı parametre güncellemeleri ürettiğini ve bu güncellemelerin eylem uzmanının Timestep Modülleri adı verilen küçük ve daha önce göz ardı edilen bileşenlerinde yoğunlaştığını ortaya koyuyor. Sistematik modül değiştirme deneyleriyle bu modüllerin RL'den elde edilen performans kazanımlarının orantısız büyük bir bölümünü yakaladığı gösteriliyor. Ayrıca shift vektörlerinin güncelleme yönlerinin görev başarısını güçlü biçimde öngördüğü, ROC-AUC değerinin %99.6'ya kadar ulaştığı saptanıyor. Shift güncellemelerinin geometrisinin görevler arası transfer örüntülerini de yansıttığı gözlemleniyor; bu bulgu, modelin farklı görevleri nasıl genellediğine dair yapısal bir içgörü sunuyor. Bu bulgulara dayanan araştırmacılar, ek RL eğitimi gerektirmeksizin yalnızca shift güncelleme yönleri boyunca yönlendirmenin RL ile eğitilmiş politikaları daha da iyileştirebildiğini kanıtlıyor. Çalışma, VLA politikalarının parametre uzayındaki iç mekaniğini derinlemesine anlamamızı sağlarken daha verimli, hesaplama açısından daha ekonomik ve yorumlanabilir RL eğitimi için somut bir yol haritası çiziyor. Robotik alanda büyük modellerin ince ayar maliyetlerini düşürme çabalarına doğrudan katkı sunması açısından da kritik bir öneme sahip.

Hugging Face Daily Papers →

TALK-Dem: Demans İletişim Örüntülerine Karşı Robot Dayanıklılığını Ölçüyor

TALK-Dem, demans kaynaklı iletişim bozukluklarıyla karşılaşan LLM tabanlı robot planlamacılarındaki kritik zayıflıkları gözler önüne seriyor.

LLM destekli robot görev planlamacıları, kullanıcıların net, eksiksiz ve odaklı talimatlar verdiğini varsayıyor; oysa demans yaşayan bireyler gibi bilişsel engelli kullanıcılarla etkileşimde bu sistemler ciddi hatalar yapabiliyor ve fiziksel güvenlik riskleri doğurabiliyor. TALK-Dem, bu boşluğu kapatmak amacıyla demans kaynaklı sözel iletişim örüntüleri altında LLM tabanlı robot görev planlamasını değerlendiren ilk benchmark'ı sunuyor. Veri kümesi 4.800 talimat içeriyor ve Referanssal Belirsizlik, Nesne Yerini Alma, Boş Konuşma, Konu Kayması ve Müdahale olmak üzere beş tipik iletişim örüntüsünü üç farklı yoğunluk düzeyinde kapsıyor. Bu çeşitlilik, gerçek hasta etkileşimlerinin karmaşıklığını yansıtmak adına özenle tasarlandı. Altı açık ağırlıklı LLM üzerinde yürütülen deneyler, modellerin ideal talimatlara kıyasla iletişim örüntülerine bağlı olarak %22.3 puana kadar performans düşüşü yaşadığını ortaya koyuyor. Bu kayıp, yardımcı robotik bağlamında yalnızca verimlilik değil, kullanıcı güvenliği açısından da ciddi sonuçlar doğurabilir. Bu bulguya yanıt olarak önerilen CARE (Context-Aware Retrieval from Experience) yöntemi, geçmiş etkileşimlerden bağlama duyarlı örnekler alarak görev başarısını ortalama 18.1 yüzde puanı artırıyor. Çalışma, gizlilik ve bağlantı kısıtları nedeniyle yerel model kullanımının zorunlu olduğu yardımcı robotik alanında hem sistematik değerlendirme hem de hedefe yönelik uyarlama stratejilerinin kritik önemini açıkça vurguluyor.

Arxiv CS.RO →

SInGA: Tek Görüntüden Animasyonlu Gaussian Kafa Avatarı

SInGA, tek bir fotoğraftan kimliğe özgü, animasyonlanabilir 3B kafa avatarı üretmek için semantik boyama kullanıyor.

SInGA, tek bir görüntüden animasyonlanabilir Gaussian kafa avatarları oluşturmak için anlamsal boyama öğrenen yeni bir yöntem. Mevcut avatar yaklaşımları çoğunlukla çok görüşlü gözlemlere dayanıyor ve tek görüş açısı senaryolarında gözlemlenemeyen bölgeleri etkili biçimde ele alamıyor. SInGA bu sorunu, UV uzayında tanımlanan bir semantik boyama çerçevesiyle çözüyor: UV temsilinin yapılandırılmış topolojisi, tutarlı uzamsal yazışmalar sağlıyor ve insan yüzünün doğal simetrisi kullanılarak kimliğe özgü özelliklerin tamamlanması mümkün kılınıyor. Gözlemlenen bölgelerden çıkarılan özellikler, gözlemlenemeyen bölgeleri tamamlamak için kullanılıyor; tamamlanan temsil daha sonra Gaussian niteliklerini regreslemek için kullanılarak etkili bir Gaussian boyama gerçekleştiriliyor. Her yüzey ya da piksel konumunda tek bir Gaussian yerine birden fazla Gaussian istiflenerek ayrıntı kalitesi ve görsel sadakat artırılıyor. Yöntem, kimliğe özgü optimizasyon veya ek görüş verisi gerektirmeksizin farklı kimliklere genelleyebiliyor ve yönlendirme girdileriyle animasyon desteği sunuyor. Bu özellik, modelin pratikte geniş bir kullanıcı kitlesine kolayca uyarlanabilmesini sağlıyor. Kapsamlı deneyler, SInGA'nın görülmemiş açılardan gerçekçi animasyon ve tutarlı render sağlarken yüksek kaliteli, kimlik koruyan avatar üretiminde mevcut yöntemleri belirgin biçimde geride bıraktığını gösteriyor. Sonuç olarak çalışma, tek görüntüden avatar oluşturma alanında hem kalite hem de pratik kullanılabilirlik açısından önemli bir ilerlemeyi temsil ediyor.

Arxiv CS.CV →