İşaret

2026-09-29 Yapay Zeka · Bilgisayarlı Görü · Doğal Dil İşleme · Robotik

Bu sayı, yapay zeka ve robotiğin ortak bir soruya verdiği yanıtları bir araya getiriyor: Sistemler, çevre ve görev ne kadar değişirse değişsin nasıl verimli kalabilir? Modüler sinir mimarilerinden ajansal öz-organizasyona, SAR görüntü transferinden mikrorobot hızlı uyarlamasına uzanan bulgular, genelleme kapasitesinin artık bir lüks değil tasarımın merkezine oturması gerektiğini gösteriyor. Bu makaleleri birlikte okumak; biyolojik ilhamın, cebirsel soyutlamanın ve veri-açlığını törpüleyen transfer yöntemlerinin aslında tek bir yapısal dönüşümün farklı yüzleri olduğunu ortaya koyuyor.

Gemini'ye Ajanlık Video Anlama Özelliği Geldi

Gemini'nin yeni ajanlık video özelliği token tüketimini %88, maliyeti %66 düşürüyor.

Google DeepMind, Gemini 3.7 Flash, 3.6 Flash ve 3.5 Flash-Lite modellerine ajanlık video anlama özelliğini ekledi. Mevcut statik işleme yöntemlerinde model, videoyu sabit kare hızında (varsayılan 1 FPS) işlerken; yeni ajanlık yaklaşım, modelin yerleşik video araçlarıyla görsel kareler, ses ve transkriptler üzerinde dinamik biçimde arama, tarama ve hedef bölümleri inceleme yapmasını sağlıyor. Bu sayede standart video analizi benchmark'larında token tüketimi %88'e, maliyet ise %66'ya kadar düşerken doğruluk %7'ye kadar artıyor. Özellik; saniyenin altında anlık olay tespiti, daha isabetli anomali algılama ve hassas sayma gibi yeni yeteneklerin kapısını açıyor. Kazanımlar özellikle 10 dakikalık nasıl yapılır videolarından 90 dakikalık derslere ve çok saatlik kayıtlara uzanan uzun formatlı içeriklerde belirgin biçimde ortaya çıkıyor; zira statik işleme yaklaşımı geliştiricileri yüksek token maliyeti ile kritik ayrıntıların kaybolması arasında zorlu bir seçime mahkûm ediyordu. Ajanlık yaklaşım bu denklemi köklü biçimde değiştiriyor: Model artık videonun tamamını körce işlemek yerine neyin inceleneceğine kendisi karar veriyor, bu da hem hesaplama verimliliğini hem de analiz kalitesini aynı anda iyileştiriyor. Özellik, Google AI Studio ve Gemini Enterprise Agent Platform üzerinden Gemini API'ye erişen geliştiricilere bugünden itibaren açık olup uzun formatlı video içeriğini işleyen uygulamalar için maliyet-performans dengesini yeniden tanımlama potansiyeli taşıyor.

DeepMind Blog →

Robotlarda Öz-Gelişimi Durduran Üç Engel

123 turda yürütülen deney, robotların öz-gelişimini kimin değil neyin engellediğini ortaya koydu.

Ulusal Singapur Üniversitesi'nden araştırmacılar, bir robotun insan kodu yazmadan kendini geliştirebilip geliştiremeyeceğini test etmek amacıyla ajanlık bir sistem kurdu. Sistem; robotun başarısızlıklarını izleyerek eksik yetenekleri tespit ediyor, yeni beceriler yazıyor ya da dış modeller yükleyerek değişiklikleri simülasyonda test ediyor ve döngüyü yeniden başlatıyordu. Ev içi manipülasyon görevleri üzerinde 123 tur çalıştırılan bu deneyde ajanlık sistem bağımsız keşifler yapabildiyse de hedef görev hiçbir zaman tamamlanamadı. Araştırmacılar darboğazı üç yapısal sorunla açıklıyor: Birincisi, zincirleme algı modülleri ilişkileri anlayamıyor; örneğin sistem rafları buluyor fakat "en üst rafa" gibi bağlamsal işaretlere yeterince yanıt veremiyor. İkincisi, beceri zincirleri öğrenmeyi ilk adıma kilitliyor; uzun görevler erken aşamada başarısız olduğundan sonraki beceriler hiç test edilemiyor. Üçüncüsü, ajanın neyi öğreneceğini değerlendirme ortamı belirliyor ve zayıf testler aktiviteyi yerinde saymaya dönüştürüyor. Bu bulgular, sistemin gerçek anlamda öz-iyileştirme yapabilmesi için algı modüllerinin ilişkisel akıl yürütmeyle güçlendirilmesi, beceri zincirlerinin aşamalı test edilmesi ve değerlendirme ortamlarının daha sıkı tasarlanması gerektiğini ortaya koyuyor. Araştırmacılar tüm bu gözlemleri, öz-iyileştiren robot sistemleri inşa etmek isteyen araştırmacılar için somut önerilere ve test edilebilir hipotezlere dönüştürdü.

Arxiv CS.RO →

Holo4: Her Arayüzde Çalışan Genel Amaçlı Ajan Modeli

Holo4, GUI'den koda, API'ye kadar her arayüzde aynı modelle çalışan yeni bir ajan serisi.

H Company, genel amaçlı bilgisayar kullanımı için tasarlanmış Holo4 model serisini yayımladı. 27 milyar parametreli yoğun model ve 35B-A3B Mixture of Experts mimarisinden oluşan seri, grafik arayüzlere tıklayıp yazabilirken kendi kodunu yazıp çalıştırabiliyor, aynı zamanda MCP ve API araçlarını da çağırabiliyor. Çoğu ajanlık model yalnızca tek bir arayüz için eğitilirken Holo4, masaüstü, web, Android ve kod sandbox ortamlarında aynı modeli kullanıyor; bu da gerçek iş akışlarında birden fazla platform arasında geçiş yapmanın önündeki temel engeli kaldırıyor. OSWorld 2.0 benchmark'ında Holo4 27B %61,7 puan alırken Claude Opus 5.5 %81,8 ile öndedir; ancak Holo4 çok daha az parametre kullanıyor ve maliyeti kapalı modellerin önemli ölçüde altında kalıyor. Bu maliyet avantajı, modeli özellikle bütçe kısıtlı geliştirme ortamları ve açık kaynak ajan ekosistemi için çekici kılıyor. Tüm benchmark skorlarının arkasındaki yörünge verileri açık kaynak olarak paylaşıldı ve Hugging Face üzerinden indirilebiliyor; bu şeffaflık, bağımsız doğrulama ve topluluk katkısının önünü açıyor. Model, özellikle açık kaynak ajan ekosisteminde uzun süredir var olan GUI-kod entegrasyon açığını kapatma potansiyeliyle öne çıkıyor ve çok platformlu ajan geliştirme için yeni bir kıyaslama noktası sunuyor.

Hugging Face Blog →

Yapay Ağlar Çoklu Görevde Beyin Gibi Modülerleşiyor

Çoklu görev öğrenimi, yapay sinir ağlarını biyolojik beyin mimarisine benzer modüler yapılara dönüştürüyor.

Nature Machine Intelligence'da yayımlanan yeni bir çalışma, bilişsel görevler üzerinde eğitilen yinelemeli sinir ağlarının, birden fazla görevi aynı anda öğrendiğinde biyolojik beyin ağlarına benzer modüler yapılar oluşturduğunu ortaya koydu. Araştırmacılar, özellikle ağın kapasitesini zorlayan görev yüklerinde çoklu görev eğitiminin modülerliği tek görev eğitimine kıyasla belirgin biçimde artırdığını gösterdi. Kademeli çoklu görev öğrenimi en yüksek modülerlik derecesini ve en iyi performansı üretiyor; bu şekilde oluşan ağlar, yalnızca uzamsal kısıtlamalara dayanan, örneğin metabolik kablolama maliyetini minimize eden modellere göre biyolojik beyin ağlarını çok daha iyi taklit ediyor. Bulgular, beyin modülerliğinin salt fiziksel değil işlevsel taleplerle de şekillendiğini kanıtlayan kontrollü bir hesaplamalı kanıt sunuyor. Başka bir deyişle, nöral devreler yalnızca enerji verimliliği baskısıyla değil, aynı anda çok sayıda farklı görevi yerine getirme zorunluluğuyla da uzmanlaşmış bölümlere ayrılıyor. Yapay zeka mimarisi ve nörobilim arasındaki bağı güçlendiren bu sonuç, modüler ağ tasarımının karmaşık bilişsel görevlere uyum kapasitesini artıran evrimsel bir strateji olduğuna işaret ediyor. Bu bulgu hem biyolojik beynin nasıl örgütlendiğini anlamamıza hem de işlevsel açıdan daha verimli yapay sinir ağı mimarileri tasarlamamıza katkı sunabilir.

Nature Machine Intelligence →

İnsansı Robot Badmintonda İnsan Rakibe Karşı Sahaya Çıktı

Hiyerarşik pekiştirmeli öğrenme, insansı robota sınırlı veriyle badminton smacı öğretti.

CoRL 2026'ya kabul edilen yeni bir çalışmada araştırmacılar, sınırlı insan hareketi verisiyle insansı robotlara badminton oynamayı öğreten üç aşamalı hiyerarşik pekiştirmeli öğrenme çerçevesi geliştirdi. Birinci aşamada seyrek etiketli vuruş olayları, hedef koşullara göre çeşitlendirilmiş bir sürekli beceri uzayına dönüştürülüyor. İkinci aşamada yüksek seviyeli bir planlayıcı, gözlemlenen volan durumuna göre bu beceri uzayından anlık seçimler yapıyor. Üçüncü aşamada bağlam koşullu bir çekişmeli düzenleyici, hareketin doğallığını korurken geri dönüş performansını düşürmüyor. Sistem bu üç aşamanın birleşimiyle, az miktarda insan hareket verisinden yüksek kaliteli motor politikaları türetiyor; bu da veri toplama maliyetini önemli ölçüde azaltıyor. Gerçek bir insansı robot üzerinde hayata geçirilen sistem; forehand, backhand ve son derece dinamik zıplayarak vuruş dahil çoklu becerilerle insan oyuncularla sürekli ralli yapabiliyor. Bu, gerçek dünyada çok becerili insan-robot rallisini dinamik sıçrama vuruşlarıyla birlikte başaran ilk insansı raket sporu sistemi olma özelliği taşıyor. Çalışma, yüksek hızlı dinamik kontrol ile tam vücut koordinasyonu gerektiren robotik görevler için önemli bir kıyaslama sunuyor ve insansı robotların spor gibi karmaşık, öngörülemeyen ortamlarda da etkin biçimde çalışabileceğini gösteriyor.

Arxiv CS.RO →

SAR Görüntülerinde Gemi Sınıflandırması Dataset Transferine Dirençsiz

SAR gemi sınıflandırma modelleri farklı dataset'lere transfer edildiğinde ciddi performans kayıpları yaşıyor.

ICPR 2026 bünyesinde kabul edilen yeni bir çalışma, Sentetik Açıklıklı Radar (SAR) görüntülerinden gemi sınıflandırmasında çapraz dataset genellemesinin ne denli kırılgan olduğunu sistematik biçimde inceledi. Araştırmacılar altı önceden eğitilmiş modeli FUSARShip ve OpenSARShip dataset'leri üzerinde üç senaryoda değerlendirdi: alan içi sınıflandırma, dataset'ler arası transfer ve bilinmeyen sınıf tespiti. Bulgular endişe verici: Bazı modeller transfer senaryosunda %64,5 doğruluk görünse de dengeli doğruluk %33,3'e kadar düşüyor; bu, modelin sınıf dengesizliğini gizleyerek yanıltıcı bir başarı tablosu sergileyebileceğini açıkça ortaya koyuyor. Başka bir deyişle, yüksek genel doğruluk rakamları, nadir görülen gemi sınıflarının neredeyse hiç doğru sınıflandırılmadığını örtbas edebiliyor. Bilinmeyen sınıf tespitinde Monte Carlo dropout varyansı çoğunlukla rastgele tahmine yakın kalırken göreve özgü belirsizlik skorları daha bilgilendirici buluyor; ancak bu bile dataset ve tutulan sınıfa göre önemli değişkenlik gösteriyor. Bu tutarsızlık, tek bir belirsizlik tahmin yönteminin tüm senaryolarda güvenilir biçimde çalışmadığını vurguluyor. Sonuçlar, SAR görüntülerinde çapraz dataset genellemesinin hâlâ çözülmemiş bir sorun olduğuna ve sahaya alınan sistemlerin değerlendirilmesinde dengeli doğruluk metriklerinin kritik önem taşıdığına güçlü bir şekilde işaret ediyor.

Arxiv CS.CV →

Transformer'larda Matris Çarpımı İlişkisel Cebirle Değiştiriliyor

Aynı parametre sayısıyla matris çarpımını daha seyrek bir cebirle değiştirmek, üretim hızını %6–7 artırıyor.

Yeni bir çalışma, Transformer modellerinde standart matris çarpımını ilişkisel cebir katmanlarıyla değiştirmeyi öneriyor. Hızlı matris çarpım algoritmaları aynı işlemi daha ucuza hesaplamaya çalışırken bu yaklaşım farklı bir soru soruyor: Aynı ağırlık bloklarını ve parametre sayısını koruyarak çarpma işleminin kendisi değiştirilebilir mi? Önerilen yapı, seyrek bir etkileşim tablosu üzerinden çalışıyor ve blok boyutu sabit tutulduğunda matris boyutunda kuadratik aritmetik sağlıyor; GPU yürütmesi için sonlu şekil kısıtlamaları türetildi ve nedensel maskeleme ile KV-cache çözümlemesiyle uyumlu hale getirildi. Bu uyumluluk, önerilen yapının mevcut Transformer eğitim altyapısına minimum değişiklikle entegre edilebileceğini gösteriyor. Yaklaşık 110 milyon parametreli iki decoder-only Transformer dil modeli üzerinde 12,3 milyar token bütçesiyle yapılan deneyde; yalnızca ileri besleme katmanı farklı olan modellerde cebirsel model dört prompt alanında uçtan uca üretim hızını %6,2–7,8 artırdı. Ancak raporlanan üç aşağı yönlü metriğin hepsinde daha düşük puan aldı; yani hız kazanımı, model kalitesinde belirgin bir düşüşle birlikte geliyor. Araştırmacılar bulgularını küçük ölçekte uygulanabilirlik ve eğitilebilirlik kanıtı olarak sunuyor, daha kapsamlı ölçeklendirme deneylerini ve kalite-hız dengesinin iyileştirilmesini ilerideki çalışmalara bırakıyor.

Hugging Face Daily Papers →

Mikrorobotlar Dakikalar İçinde Eğitilip Sıfır-Shot Transfer Edilebiliyor

Yeni bir öğrenme çerçevesi, mikrorobot navigasyon politikalarını dakikalar içinde eğitip farklı platformlara aktarıyor.

Nature Machine Intelligence'da yayımlanan bu çalışma, derin pekiştirmeli öğrenmeyle mikrorobot navigasyonunun eğitim süresini saatlerden dakikalara indiren bir çerçeve sunuyor. Araştırmacılar 10.000'den fazla yapay damar ortamını paralel çalıştıran, saniyede yaklaşık 190.000 geçiş üretebilen tam vektörize bir simülatör geliştirdi; bu simülatör dinamikleri, ışın izleme tabanlı görsel özellik çıkarımı ve uygunluk kontrollerini eş zamanlı yürütüyor. Bu paralel mimari, eğitim verimliliğini geleneksel yaklaşımlara kıyasla katbekat artırıyor ve büyük ölçekli ortam çeşitliliğini mümkün kılıyor. Yakınsama hızını artırmak ve hareket tutarlılığını iyileştirmek için tasarlanmış görev-şekillendirme-düzenleme (TSR) ödül çerçevesiyle desteklenen sistem; aksiyon varyasyonunu en az %33,7 azaltıyor, engel boşluğunu en az %2,1 artırıyor ve eğitim süresini 10 dakikanın altına çekiyor. Üstelik eğitilen politikalar yeniden eğitime gerek kalmadan farklı mikrorobot tipleri ve navigasyon senaryolarında sıfır-shot olarak sahaya alınabiliyor. Bu transfer yeteneği, her yeni senaryo için baştan eğitim maliyeti doğuran mevcut sistemlere göre önemli bir pratik avantaj sunuyor. Hedeflenen tedavi ve müdahale uygulamalarında mikrorobotların hızla devreye alınmasının önündeki en büyük engellerden birini ortadan kaldıran bu çalışma, otonom mikrorobot tasarım döngüsünü kısaltma açısından kritik bir ilerlemeye işaret ediyor.

Nature Machine Intelligence →