Bu sayı, yapay zeka ve bilgisayarlı görünün aynı anda hem derinleştiğini hem de genişlediğini gösteriyor: temel modeller ultrason ve otonom sürüş gibi alanlara nüfuz ederken, mimari yenilik manifold geometrisiyle dikkat mekanizmalarını, spiking sinir ağlarıyla olay kameralarını ve grafik yapılarıyla dünya modellerini yeniden kurgulamaya devam ediyor. Sekiz makaleyi bir arada okumak, ölçek ile özgünlüğün birbirini dışlamadığını; aksine birbirini beslediğini açıkça ortaya koyuyor.
1.
Araştırma
Otonom Sürüşte 4D Radar Algısı: Kapsamlı Bir İnceleme
Sinyal işlemeden sahne yeniden yapılandırmasına 4D milimetre dalga radarı algoritmalarının tam haritası çıkarıldı.
Otonom sürüş için 4D milimetre dalga radarı algı algoritmaları üzerine hazırlanan bu kapsamlı literatür taraması, alanın sinyal işleme ve nesne tespitinin ötesine nasıl genişlediğini belgeliyor. Çalışma; anlamsal bölümleme, hareket tahmini, doluluk kestirimi ve dinamik sahne yeniden yapılandırması gibi görev kategorilerini algı görevlerinin ve algoritmaların evrimi ekseninde sistematik biçimde düzenliyor. Radar temelleri, veri temsilleri ve kalite iyileştirme yöntemlerine ilişkin kapsamlı bir giriş sunulduktan sonra nesne düzeyinde algı, hareket ve konumlandırma, yerel ve yoğun uzamsal algı ile dinamik sahne anlama başlıkları altında mevcut yaklaşımlar karşılaştırılıyor. Yalnızca radar kullanan öğrenme yöntemleri, çok modlu füzyon ve çapraz modal bilgi damıtma stratejileri de değerlendirme kapsamında. Öne çıkan bir nokta: irtifa ölçümleri, Doppler verileri ve radar fiziksel ön bilgilerinin farklı görevlerde nasıl kullanıldığı ayrıntılı biçimde ele alınıyor. Mevcut veri setlerinin görev kapsamı, girdi türleri, etiket yapıları ve değerlendirme protokolleri de özetleniyor. IEEE Sensors Journal'a gönderilen bu derleme, seyrek nesne algısından dinamik uzamsal kavrayışa geçişi görev odaklı bir perspektifle sunarak araştırmacılara ve uygulayıcılara kapsamlı bir referans kaynağı sunuyor.
Arxiv CS.RO →
Paylaş: X · LinkedIn
2.
Araştırma
SonoBase: Ultrason için Açık Kaynak Temel Yapay Zeka Modeli
456 bin görüntü ve 1,6 milyon uzman maskesiyle eğitilen SonoBase, klinik ultrason yapay zekasında yeni bir çağ başlatıyor.
Dünya genelinde en yaygın kullanılan görüntüleme yöntemi olan ultrasonun klinik yapay zekası, bugüne kadar cihaz, operatör veya anatomi değiştiğinde başarısız olan dar kapsamlı tek görevli modellerle sınırlı kaldı. Bu çalışma, 53 genel veri setinden 24 klinik uygulama ve 17 ülkeyi kapsayan 456.963 görüntü ile 1.626.085 uzman maskesini bir araya getiren SonoCorpus adlı açık kaynağı ve bu veri üzerinde ön eğitim yapılan etkileşimli bölümleme temel modeli SonoBase'i tanıtıyor. On beş farklı değerlendirme veri seti üzerinde gerçekleştirilen testlerde SonoBase; SAM2, MedSAM2 ve MedSAM3 modellerini her veri setinde geride bırakırken aynı verilerle eğitilmiş göreve özel uzman modellerle yarışır seviyeye ulaşıyor. Tam harici verilerde ise diğer modellerin kendi dağılım içi benchmark'larında elde ettikleri doğruluğu bile aşıyor. Ejeksiyon fraksiyonu ölçümündeki %6,63 hata gözlemciler arası değişkenlik sınırının içinde kalıyor; fetal baş çevresi ve gebelik yaşı tahminleri de benzer şekilde klinik eşiğin altında. Eğitimli kullanıcılara ihtiyaç duymadan Sierra Leone ve Tanzanya'da taşınabilir problarla çalışabilen model, klinik yapay zekanın coğrafi eşitsizliklerini aşma potansiyeli taşıyor.
Arxiv CS.CV →
Paylaş: X · LinkedIn
3.
Araştırma
GAVEL: Grafik Dünya Modelleriyle Robot Görev Planlaması
GAVEL, LLM tabanlı robot planlamasında başarı oranını %41'den %92'ye taşıyan grafik dünya modeli çerçevesi.
Büyük dil modelleri (LLM), uzun ufuklu robot görev planlaması için esnek bir arayüz sunarken ürettikleri planlar çoğunlukla beden kısıtlamalarına uymakta, hatalardan kurtulmakta ve kısmi gözlemlenebilirlik altında akıl yürütmekte yetersiz kalıyor. GAVEL, bu sorunu açık bir grafik dünya modeli etrafında inşa edilmiş doğrulama ve onarım çerçevesiyle çözmeyi amaçlıyor. Grafik; ilgili nesne ilişkilerini, eylem ön koşullarını ve etkilerini, gözlemlenemeyen nesne konumlarına dair olasılıksal inançları temsil ediyor. Bu model, LLM tarafından üretilen eylemlerin sonuçlarını yürütmeden önce tahmin edebiliyor, ihlalleri tespit edip dünya modelinden doğrudan çözülebilen hataları onarıyor; semantik akıl yürütme gerektiren hatalar için ise LLM'e yeniden planlama görevi devrediliyor. BEHAVIOR-1K üzerinde 100 tek görev ve 500 çok görevli talimatla yapılan değerlendirmede Qwen3-8B ile GAVEL, tek görev başarısını %41,2'den %91,8'e, çok görev başarısını ise %19,9'dan %92,6'ya çıkarıyor. Dağılımsal inanç akıl yürütmesi ayrıca seyahat mesafesini yaklaşık %5,4 azaltıyor. Sonuçlar, açık grafik dünya modelinin hem küçük hem de büyük ölçekli LLM kapasiteleriyle güvenilir ve verimli uzun ufuklu maddileştirilmiş planlamayı önemli ölçüde iyileştirebildiğini ortaya koyuyor.
Arxiv CS.RO →
Paylaş: X · LinkedIn
4.
Endüstri
Google DeepMind, Gemini 3.8 Live Modellerini Tanıttı
Gemini 3.8 Live ve Extended Thinking, gerçek zamanlı sesli etkileşimde paralel akıl yürütmeyle yeni bir çıta belirliyor.
Google DeepMind, sesli yapay zeka etkileşimlerini daha doğal ve zekice kılmak amacıyla iki yeni model tanıttı: Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking. Gemini 3.8 Live, ölçek ve maliyet verimliliği için tasarlanmış olup akıcı diyalog ile görsel zemine dayanan konuşma zekasını bir araya getiriyor. Gemini 3.8 Live Extended Thinking ise yüksek karmaşıklıktaki görevler için geliştirilmiş; çok adımlı akıl yürütme kapasitesiyle öne çıkıyor. Her iki model de konuşmayı kesintiye uğratmadan arka planda araç yönetimi yapabiliyor, dil değişimlerini ve kullanıcı müdahalelerini sorunsuz biçimde yönetiyor. Paralel akıl yürütme kapasitesi sayesinde modeller, karmaşık bir problem üzerinde çalışırken eş zamanlı olarak sohbet etmeye devam edebiliyor; bu da gerçek zamanlı asistan deneyimini köklü biçimde dönüştürüyor. Geliştiriciler ve kurumsal kullanıcılar için Gemini API üzerinden erişilebilen modeller, aynı zamanda Gemini uygulaması, Google Workspace ve Google Search'te de kullanıma sunuldu. Bu entegrasyon, modellerin yalnızca araştırma ortamında değil, günlük iş akışlarında da karşılık bulacağına işaret ediyor. Sesli yapay zeka ajanlarını üretim ortamına taşımak isteyen ekipler için güvenilir ve ölçeklenebilir bir altyapı sunan bu adım, Google'ın ses odaklı yapay zeka alanındaki rekabetini belirgin biçimde güçlendiriyor ve sektörde standartların yeniden tanımlanmasına zemin hazırlıyor.
DeepMind Blog →
Paylaş: X · LinkedIn
5.
Araştırma
LLM Benchmark'larında Ne Bekliyoruz? Sistematik Bir Haritalama
14.767 benchmark makalesini analiz eden çalışma, LLM değerlendirme beklentilerinin 2022-2026 arasında nasıl evrildiğini ortaya koyuyor.
Büyük dil modellerinde (LLM) ilerlemenin nasıl ölçüldüğü ve aktarıldığı büyük ölçüde benchmark'lara dayanıyor; ancak model sıralamaları, değerlendirme gereksinimlerinin kendisinin nasıl evrildiğini yeterince yansıtmıyor. Bu çalışma, Ocak 2022 ile Ağustos 2026 arasında arXiv'de yayımlanan, yeni bir değerlendirme kaynağı sunan ya da mevcut olanı güncelleyen 14.767 makaleyi sistematik biçimde inceliyor. Aşamalı tarama ve otomatik tam metin kodlaması kullanılarak hedef sistemler ve uygulama alanları, değerlendirme materyalleri ile test koşulları ve puanlama mekanizmalarındaki değişimler ayrıntılı olarak mercek altına alınıyor. Bulgular dikkat çekici bir tablo ortaya koyuyor: Eylem, etkileşim ve profesyonel uygulamalara yönelik benchmark'larda belirgin bir artış gözlemlenirken LLM tabanlı puanlama hem ajan hem de ajan olmayan gruplarda hızla büyüyor. Buna karşın model tarafından üretilen değerlendirme materyallerinde karşılaştırılabilir bir artış henüz görülmüyor. Çalışma, kamu araştırmalarının kapasite beklentilerini somut test kriterlerine nasıl dönüştürdüğünü aydınlatırken kritik bir soruyu da gündeme taşıyor: Yapay zekanın testleri oluşturma, görevleri yürütme ve yanıtları yargılama süreçlerine giderek daha fazla dahil olması, değerlendirmenin bağımsızlığını ve güvenilirliğini zayıflatır mı? Değerlendirme altyapısının geleceğini şekillendirmek isteyen araştırmacılar ve politika yapıcılar için bu meta-analiz, alanın nereye gittiğini anlamlandırmada önemli bir referans noktası sunuyor.
Arxiv CS.AI →
Paylaş: X · LinkedIn
6.
Araştırma
SAM3 ile Eğitimsiz Açık Kelime Dağarcıklı 3B Nesne Tespiti
SAM3 tabanlı bu sistem, hiç etiket kullanmadan otonom sürüşte 3B nesne tespitinde 0,298 mAP elde ediyor.
Otonom sürüş için 3B nesne tespiti bugüne kadar büyük ölçekli insan etiketli veri setleriyle eğitilen ve sabit kategori listelerine bağlı kalan modellerle yönetiliyordu; listenin dışındaki her nesne görünmez kalıyordu. Bu çalışma, görevin eğitimsiz ve açık kelime dağarcıklı biçimde çözülüp çözülemeyeceğini soruyor. Metin istemleriyle sorgulanan SAM3, aracın altı çevreleyen kamerasında örnek maskeleri üretiyor; maskeler ise sahne geometrisi kullanılarak metrik 3B kutulara dönüştürülüyor. nuScenes veri setinde yürütülen kontrollü üç aşamalı karşılaştırmada yalnızca görüntüden geometri tahmini 0,183 mAP sağlarken aynı maskelerin içinde ham LiDAR noktalarına etiketizsiz kural uydurulması, sıfır etiket maliyetiyle 0,298 mAP ve 0,348 NDS'ye ulaşıyor. Denetimli kutu geometrisi ödünç alındığında bu değer 0,413 mAP/0,555 NDS'ye yükseliyor; bu sonuç, sistemin asıl zayıf noktasının 2B tespit değil, ölçüm hassasiyeti olduğunu ortaya koyuyor. SAM3'ün kapsama analizi, menzil içi nesnelerin %84'ünü doğru biçimde etiketli maske ile tespit edebildiğini gösteriyor. Açık kelime dağarcıklı algının ölçeklenebilir bir alternatif olabileceğine işaret eden bu bulgular, otonom araç geliştirmede etiketleme maliyetlerini önemli ölçüde düşürme potansiyeli taşıyor.
Arxiv CS.CV →
Paylaş: X · LinkedIn
7.
Araştırma
Stiefel Attention: Transformer Projeksiyon Matrislerinde Riemannian Optimizasyon
Dikkat mekanizmasındaki Q/K matrislerini Stiefel manifolduna kısıtlamak, CIFAR-10'da %8,98 puan kazanım sağladı.
Transformer mimarisindeki sorgu ve anahtar projeksiyon matrisleri (WQ, WK) neredeyse her zaman geometrileri üzerinde herhangi bir kısıtlama olmaksızın Öklid optimizörlerle eğitiliyor. Bu çalışma söz konusu matrisleri Stiefel manifolduyla kısıtlıyor ve çerçeve başına tek bir skaler ikinci moment taşıyan, adımını güven bölgesiyle sınırlayan ve kutupsal geri çekme uygulayan bir Riemannian Adam ile optimize ediyor. Dört önerme; bu güncellemenin gömülü metrikte en dik iniş olduğunu, gradyan ölçeğinden bağımsız olduğunu, iyi koşullandırılmış olduğunu ve tam O(d)-eşdeğişken olduğunu kanıtlıyor. Temel mekanizma ise şu: Ağırlık azalmasının Stiefel manifoldu üzerinde Riemannian gradyanı özdeş olarak sıfır olduğundan öğrenilen dikkat geometrisi, azalmanın modelin geri kalanında tetiklediği çöküş döngülerinden korunuyor. Modüler aritmetik genelleme deneyinde tek çalıştırmada, karşılaştırma modelinin %61,1 doğruluğuna karşın 20.000. dönemde %97,0 doğrulama doğruluğunu koruyor. CIFAR-10 yamaları üzerinde aynı kural 12 eşleştirilmiş başlangıçta ortalama +8,98 puan kazandırıyor; üstelik bu fark verinin artmasıyla daha da büyüyor. Sonuçlar, transformer'larda projeksiyon matrislerinin geometrisinin eğitim dinamikleri üzerindeki etkisini net biçimde ortaya koyuyor.
Arxiv CS.LG →
Paylaş: X · LinkedIn
8.
Araştırma
REACT: Olay Kameraları için Tam Spiking Durum-Uzayı Modeli
REACT, olay kamerası akışını çerçeve biriktirmeden işleyerek çarpışma tahmininde 4,6 ms gecikmeyle gerçek zamanlı algı sağlıyor.
Dinamik ortamlarda çalışan robot sistemleri, gelen duyusal akışla sürekli evrilen görsel algıya ihtiyaç duyuyor. Olay kameraları mikrosaniye düzeyinde zamansal çözünürlük ve asenkron algılama sunuyor; ancak öğrenme tabanlı yöntemlerin büyük çoğunluğu olayları çerçeveler veya zamansal kutular halinde biriktiriyor ve bu entegrasyon gecikmesi hızlı tepkiyi kısıtlıyor. REACT, ham olayları zamansal birikim olmaksızın tek tek işleyen tam spiking durum-uzayı modeli olarak bu sorunu çözmeyi hedefliyor. Karmaşık değerli spiking nöronu C-SiLIF kullanan REACT, nöronun sürekli zaman dinamiklerini fiziksel olay-arası aralıkla yönlendirerek iç durumun bireysel olayların zamansal çözünürlüğünde evrilmesini sağlıyor. EvTTC veri setinde hedef sınırlayıcı kutu veya konum girdisi olmaksızın %9,59 göreli çarpışma süresi hatası ve 4,6 ms uçtan uca çıkarım gecikmesiyle en iyi öğrenilen yönteme yalnızca 0,15 puan geride kalıyor. Bu gecikme, ortalama yaklaşma hızında yalnızca 4 cm araç hareketine karşılık gelirken en hızlı rakip yöntemde bu değer 1 metreye çıkıyor. INT8 nicemleme ile enerji tüketimi 18,5 mJ'den 2,8 mJ'e düşürülen REACT, reaktif robotik sistemler için düşük gecikmeli sürekli temporal algının spiking sinir ağlarıyla gerçekleştirilebileceğini kanıtlıyor.
Arxiv CS.RO →
Paylaş: X · LinkedIn