Bu sayı, yapay zekanın gerçek dünyayla temas ettiği üç kritik sınırı mercek altına alıyor: algı (nanodronlardan açık hava manipülasyonuna, yoğun 3B takipten dokunsal temsile uzanan duyu katmanı), temsil (topoloji farkında gömüler, olasılıksal prompt adaptasyonu ve dünya modeli hizalaması aracılığıyla anlam inşası) ve güvenilirlik (LLM güven kalibrasyonu, güvenli taklit öğrenimi). Sekiz çalışmayı bir arada okumak, robotik ve dil sistemlerinin artık ayrı başlıklar olmadığını; hepsinin ortak bir olgunluk sorusuna —sisteminiz ne kadar derinden algılıyor, ne kadar zengin temsil ediyor ve ne kadar güvenilir karar veriyor— yanıt aradığını gösteriyor.
1.
Araştırma
TinyCVIO: Nanodronlar için 520 kB'da Gerçek Zamanlı Konum Tahmini
Yalnızca 520 kB SRAM'e sahip çift çekirdekli mikrodenetleyicide çalışan TinyCVIO, nanodronlarda 3.5 cm'lik yörünge hatası başarıyor.
TinyCVIO, yalnızca 520 kB SRAM kapasitesine sahip ticari bir çift çekirdekli mikrodenetleyici üzerinde çalışan, nanodronlara özgü görsel-inersiyal bir odometri sistemidir. Sistem; minyatür LED takımyıldızlarını bilinen geometrik referans noktaları olarak kullanan hafif bir görsel ön uç, milimetre ölçekli bir kamerayla 29.2 kare/saniye hızında LED gözlemleri yapan bir akış işlem hattı ve sabit filtre-durum boyutunu koruyan rijit-tahta ölçüm modelinden oluşuyor. Rijit-tahta modeli, LED'lerin düzlemsel nokta olarak ele alındığı yaklaşıma kıyasla ortalama mutlak yörünge hatasını yüzde 27 oranında azaltıyor; bu fark, kısıtlı donanım üzerinde doğru konum tahmini yapabilmenin ne denli kritik olduğunu somut biçimde ortaya koyuyor. Crazyflie nanodron platformunda farklı uçuş hızlarında gerçekleştirilen dokuz bağımsız uçuşta sistem; 10 metrelik yörünge bölümlerinde 3.5–3.7 cm ortalama mutlak yörünge hatası, yüzde 0.50–0.60 göreceli konum hatası ve 15.7–16.3 ms ortalama tahmin gecikmesi elde etti. Bu değerler, gerçek zamanlı kontrol döngüleri için yeterince düşük bir gecikmeye işaret ediyor. Harici bir konumlandırma altyapısına, önceden yerleştirilmiş işaretçilere ya da ağır bilgisayar donanımına gerek duymadan bu performansın yakalanması, TinyCVIO'yu özellikle GPS'in kullanılamadığı iç mekan ortamlarında cazip kılıyor. Sistem, kaynak kısıtlı platformlarda özerk navigasyonun sınırlarını yeniden tanımlarken, benzer bütçeli donanımlara sahip diğer küçük robotik platformlara da kolaylıkla uyarlanabilecek bir mimari sunuyor.
Arxiv CS.RO →
Paylaş: X · LinkedIn
2.
Araştırma
Açık Havada İnsansız Hava Araçlarıyla Hassas Manipülasyon
Taklit öğrenimi, LiDAR-inersiyal odometri ve tam gövde kontrolünü birleştiren sistem, iç mekan altyapısı olmadan açık havada manipülasyon gerçekleştiriyor.
Araştırmacılar, açık hava ortamlarında havadan manipülasyonu mümkün kılan kapsamlı ve entegre bir çerçeve sundu. Sistem, birbiriyle uyumlu çalışan üç temel bileşeni bir araya getiriyor: manipülasyon gösterilerinden uçtan uca eğitilen ve istenen son efektör hareketlerini üreten bir Diffusion Policy; harici hareket-yakalama sistemlerine ya da GPS altyapısına gerek kalmadan açık havada güvenilir durum tahmini sağlayan yerleşik LiDAR-inersiyal odometri; ve hem hava platformunu hem de manipülatör kolunu eş zamanlı koordine eden tam gövde model öngörülü kontrol (MPC). Diffusion Policy'den gelen komutlar doğrudan tam gövde MPC'ye beslenerek istenilen uç nokta yörüngesi gerçek zamanlı olarak gerçekleştiriliyor; bu mimari, politika ile kontrol katmanı arasındaki alışılagelmiş ayrımı ortadan kaldırıyor. Sistem, fiziksel bir hava manipülatörü platformu üzerinde kapsamlı biçimde doğrulandı ve farklı açık hava koşullarındaki manipülasyon görevlerini başarıyla tamamladı. Çalışma, gösteri tabanlı manipülasyon politikalarının yerleşik durum tahmini ve model tabanlı kontrolle etkin biçimde birleştirilebileceğini deneysel olarak ortaya koyuyor. Bu bulgu, robotik manipülasyonun kontrollü iç mekan ortamlarının çok ötesine taşınması için somut ve tekrarlanabilir bir yol haritası sunması açısından büyük önem taşıyor.
Arxiv CS.RO →
Paylaş: X · LinkedIn
3.
Araştırma
Tactile-JEPA: Robotlar için Topoloji Farkında Dokunsal Temsil Öğrenimi
Tactile-JEPA, dağıtık dokunsal sensörler için öz-denetimli ön eğitim yaparak kuvvet tahmin hatasını %6.3, elde yönelim hatasını %20.8 azaltıyor.
Tactile-JEPA, temas yoğun ve el becerisi gerektiren manipülasyon görevleri için dağıtık elektronik deri sensörlerine yönelik topoloji farkında, öz-denetimli bir ön eğitim yöntemi sunuyor. Görsel tabanlı dokunsal sensörlere odaklanan ve düzenli piksel yapısını varsayan mevcut öz-denetimli öğrenme yaklaşımlarının aksine, Tactile-JEPA seyrek ve düzensiz biçimde yerleştirilmiş algılama elemanlarının kendine özgü topolojik yapısını doğrudan ele alıyor. Yöntem; sensörler arasındaki bağlantı grafını rehber olarak kullanan uzamsal maskeleme stratejisi sayesinde, maskelenmiş algılama elemanlarının gömü temsillerini tahmin etmeyi öğreniyor. Hem lokal temas detaylarını hem de dokunsal yüzeyin genel durum bilgisini eş zamanlı yakalamak amacıyla çift ölçekli maskeleme stratejisi benimseniyor; bu yapı, modelin farklı soyutlama düzeylerinde anlamlı özellikler öğrenmesine olanak tanıyor. Manyetik ve piezorezistif sensörleri, farklı robot bedenlerini ve tek ile çift sensör konfigürasyonlarını kapsayan üç farklı dataset üzerinde gerçekleştirilen değerlendirmelerde Tactile-JEPA, kuvvet tahmin hatasını yüzde 6.3, elde yönelim tahmin hatasını ise yüzde 20.8 oranında azalttı. Bu sonuçlar, robotik dokunsal algıda önceden eğitilmiş temsillerin sıfırdan eğitime güçlü bir alternatif oluşturduğunu ve az etiketli veriyle bile rekabetçi performans elde edilebileceğini ikna edici biçimde gösteriyor.
Hugging Face Daily Papers →
Paylaş: X · LinkedIn
4.
Araştırma
LLM'ler Güven Sinyallerine Göre Karar Veriyor
Nature Machine Intelligence'da yayımlanan çalışma, LLM'lerdeki güven sinyallerini nedensel olarak manipüle ederek modellerin yanıtlama/çekimser kalma kararlarını nasıl aldığını ortaya koydu.
Nature Machine Intelligence'da yayımlanan bu çalışma, büyük dil modellerinin (LLM) bir soruyu yanıtlayıp yanıtlamamaya karar verirken iç güven sinyallerini gerçekten kullanıp kullanmadığını dört aşamalı deneysel bir paradigmayla sistematik olarak inceledi. Birinci aşamada modellerin temel güven düzeyleri çeşitli sorular üzerinden ölçüldü. İkinci aşamada LLM'lerin çekimser kalırken örtük bir güven eşiği uyguladığı gösterildi ve güvenin alternatif açıklayıcı mekanizmalara kıyasla yaklaşık on kat daha büyük etki büyüklüğüne sahip olduğu saptandı. Üçüncü aşamada aktivasyon yönlendirmesi tekniğiyle nedensel kanıt elde edildi: güven sinyali yapay olarak artırıldığında modelin çekimserliği azaldı, sinyal bastırıldığında ise çekimserlik belirgin biçimde arttı. Dördüncü aşamada ise modeller farklı güven seviyelerinde çekimser kalmaya açıkça yönlendirildi ve bu politikayı tutarlı biçimde uygulayabildikleri gözlemlendi. Ayrıca sözel güven ifadelerinin, token log olasılıklarından bağımsız biçimde çekimserliği anlamlı düzeyde yordadığı da bulundu. Bulgular, LLM'lerin çok boyutlu bir iç güven temsiline ve eşik tabanlı karar politikalarına sahip olduğuna işaret ediyor. Bu durum, modellerin özerk ajan olarak kendi belirsizliklerini yönetme kapasitesi açısından kritik önem taşıyor ve güvenilir yapay zeka sistemleri tasarımına doğrudan katkı sağlıyor.
Nature Machine Intelligence →
Paylaş: X · LinkedIn
5.
Araştırma
WALT: Dünya Modeli ile Hizalanmış Yörünge Planlaması
WALT, görsel dünya modeli ile geometrik yörüngeler arasındaki uyumsuzluğu gidererek otonom sürüşte planlama FLOPs'larını %30 azaltıyor.
WALT (World-Model Alignment for Latent Trajectories), sürüş dünyası modellerinin görsel tahmin gücünü yörünge planlamasına aktaran yeni bir çerçeve sunuyor. Temel sorun şu: görsel dünya modelleri ortam hakkında zengin ve anlamlı tahminler öğrense de bu üst düzey temsiller ile ham geometrik yörüngeler arasındaki anlam boşluğu, etkili planlamayı kısıtlıyor. WALT, dondurulmuş önceden eğitilmiş bir dünya modelinin semantik bilgisini, çift dallı bir yörünge otokodlayıcısı aracılığıyla kompakt bir latent uzaya aktarıyor; bu süreçte dünya modelinin ağırlıklarında herhangi bir değişiklik yapmıyor. Böylece yalnızca planlama bileşeni güncelleniyor ve önceden öğrenilmiş görsel temsillerin bütünlüğü korunuyor. Latent öğrenme için JEPA ve REPA mimarileri sistematik biçimde karşılaştırmalı olarak inceleniyor. NAVSIM benchmark'larındaki değerlendirmelerde WALT; NAVSIMv1'de PDMS skorunu 89.4'ten 89.8'e, NAVSIMv2'de ise EPDMS'i 87.3'ten 87.9'a yükseltirken yörünge planlayıcısının hesaplama maliyetini yüzde 30.5 oranında azalttı. Sonuçlar, dünya modelinin zengin temsillerini korurken eylem-ilgili bilgiyi ayrıştırarak çıkarmanın hem verimli hem de performanslı bir planlama arayüzü sağladığını açıkça gösteriyor; bu yaklaşım, otonom sürüş sistemlerinin ölçeklendirilmesinde pratik bir yol sunuyor.
Arxiv CS.RO →
Paylaş: X · LinkedIn
6.
Araştırma
TrackEverything: 1000 Kareyi Aşan Videolarda Yoğun 3B Nokta Takibi
TrackEverything, videoları kalıcı 3B sahne parçacıklarına dönüştürerek seyrek ve kısa klip takibi arasındaki temel ödünleşimi ortadan kaldırıyor.
TrackEverything, mevcut nokta takip modellerinin karşılaştığı temel ödünleşimi — ya uzun ufuklarda yalnızca seyrek nokta takibi ya da kısa kliplerde yoğun ama sınırlı takip — aynı anda kıran kapsamlı bir 3B nokta takipçisi sunuyor. Sistem, videoları dünya koordinatlarında kalıcı 3B sahne parçacıkları olarak temsil ediyor; bu sayede model karmaşıklığı video süresinden değil, sahnedeki benzersiz fiziksel geometriden bağımsız hale geliyor ve uzun videoların bellek maliyeti kontrol altında tutuluyor. Üç temel yenilik öne çıkıyor: aynı yüzeyin tekrarlı gözlemlenmesini önleyen ve veri verimliliğini artıran vokselizasyon tabanlı tekilleştirme mekanizması; her noktanın hem hedef konumunu hem de statik/dinamik sınıfını tahmin eden bir uç nokta iyileştiricisi ile yalnızca dinamik noktalar için yoğun yörüngeler çıkaran hafif bir yörünge iyileştiricisi; ve bellek açısından yük oluşturan 4B korelasyon hacimlerini verimli özellik örneklemesiyle ikame eden 3D WAFT modülü. TAP-Vid-3D benchmark'ında TrackEverything, kısa kliplerde tüm açık kaynaklı yoğun 3B takipçileri yüzde 20'den fazla APD farkıyla geride bıraktı. Bunun yanı sıra, 40 GB GPU belleğiyle 1000 kareyi aşan videolarda tüm görünür noktaları kesintisiz takip eden ilk 3B takipçi olma özelliğini taşıyor; bu da gerçek dünya uygulamaları için kritik bir ölçeklenebilirlik eşiğini temsil ediyor.
Hugging Face Daily Papers →
Paylaş: X · LinkedIn
7.
Araştırma
Policy-Calibrated DAgger: Güvenli Taklit Öğrenimi için Çevrimdışı Gürültü Kalibrasyonu
Policy-Calibrated DAgger, robotu tehlikeli durumlara sokmadan diffusion policy'nin kendi tahmin dağılımından gürültü kalibrasyonu yapıyor.
Taklit öğrenimi ile eğitilen politikalar, kapalı döngü kontrolde zamanla hata biriktirerek robotu eğitim dağılımının dışına sürükler; kovariyant kayma (covariate shift) olarak bilinen bu sorun, mevcut çözümleri ya robotu güvensiz koşullara sokmaya ya da uygun gürültü dağılımını elle seçip denemeye mahkum ediyor. Policy-Calibrated DAgger, bu sorunu diffusion politikalarının üretken özelliklerinden yararlanarak daha prensipli bir yolla çözüyor: politikanın kendi tahmin edilen eylem dağılımını kullanarak gürültüyü çevrimdışı kalibre ediyor ve böylece el ile ayarlama ihtiyacını ortadan kaldırıyor. Yöntem, uzman yörüngesi boyunca gözlemlerdeki diffusion politikasının tahmin yayılımını ölçüyor ve kapalı döngü hatasını kaydedilmiş referans yörüngeye göre değerlendiriyor. Çok modlu eylem uzayında hata ölçümündeki güçlüklerin üstesinden gelmek için kısmi gürültü giderme yoluyla politika yörüngeye yönlendiriliyor; ardından diffusion modelinin kendine özgü özellikleri kullanılarak hata normalize ediliyor. Dağınık ve dar ortamda motor kolu ulaşma görevini içeren deneysel değerlendirmelerde yöntem, gürültüsüz veri toplama yaklaşımını tutarlı biçimde geride bıraktı ve farklı gürültü düzeyleri üzerinde kapsamlı arama yapmaya gerek kalmadan en iyi gürültü seviyesiyle eşdeğer performans sergiledi. Bu yaklaşım, güvenli, verimli ve otomatik olarak ayarlanabilen taklit öğrenimi için somut ve pratik bir yol sunuyor.
Arxiv CS.RO →
Paylaş: X · LinkedIn
8.
Araştırma
ProCAP: CLIP için Olasılıksal Çapraz Dikkatli Prompt Öğrenimi
ProCAP, CLIP ağırlıklarını değiştirmeden Gaussian prompt tokenları ve çift yönlü çapraz dikkatle az örnekli genellemeyi ve alan transferini güçlendiriyor.
ProCAP, CLIP gibi önceden eğitilmiş görü-dil modellerini az etiketli veri ve dağılım kayması koşullarına uyarlamak için olasılıksal çapraz dikkatli bir prompt öğrenimi çerçevesi sunuyor. Mevcut çok modlu prompt öğrenicilerinin görsel ve metinsel dalları zayıf biçimde ilişkilendirdiği ve az örnekli rejimlerde aşırı uyuma eğilimli olduğu gözleminden yola çıkıyor. ProCAP, CLIP ağırlıklarına dokunmadan hem görsel hem de metinsel prompt tokenları eş zamanlı olarak öğreniyor; bu iki dal, yığılmış çift yönlü çok başlı çapraz dikkat mekanizmasıyla birbirine bağlanarak prompt derinliği boyunca karşılıklı ve iteratif iyileştirme gerçekleştiriyor. Sınırlı denetim altındaki aşırı uyumu azaltmak için prompt tokenlar, Gaussian ortalama ve varyanslarla parametrelendiriliyor; hafif KL ve L2 cezaları ile simetrik bir InfoNCE başlığıyla düzenleniyor. Bu olasılıksal yaklaşım, modelin belirsiz durumlarda bile tutarlı genelleme yapmasını destekliyor. On bir farklı dataset üzerinde gerçekleştirilen kapsamlı değerlendirmelerde; az örnekli bazdan yeni kategoriye genelleme, çapraz dataset transferi ve ImageNet dağılım kayması senaryolarında ProCAP, güçlü bir temel-yeni performansı ve rekabetçi transfer sonuçları elde etti. Bu yöntem, büyük görü-dil modellerini ek eğitim maliyeti minimum düzeyde tutarak yeni alanlara etkin biçimde uyarlamak için umut verici bir yaklaşım sunuyor.
Arxiv CS.CV →
Paylaş: X · LinkedIn