Cosmos 3: Fiziksel Yapay Zeka için Çok Modlu Dünya Modelleri

🕒 6 min read

NVIDIA ekibi, 5 Haziran 2026’da Cosmos 3 adlı çok modlu temel modelini yayınladığını bildiriyor; bu model dil, görüntü, video, ses ve eylemi tek bir Mixture‑of‑Transformers (MoT) mimarisi içinde birleştiriyor. Sistem Linux Foundation’ın OpenMDW‑1.1 lisansı altında açık kaynak olup GitHub’da kod, Hugging Face’de kontrol noktaları, sentetik veri setleri ve NVIDIA’nın Cosmos Lab sitesinde barındırdığı bir değerlendirme benchmark’uyla birlikte sunuluyor.

Birleştirilmiş Mixture‑of‑Transformers Mimarisi

Cosmos 3 Omnimodal World

Çift Kule Tasarımı ve Ortak Dikkat

Cosmos 3 Omnimodal World - Çift Kule Tasarımı ve Ortak Dikkat

Makale, her çözücü katmanının iki bağımsız parametre seti içerdiğini belirtiyor: dil, görüntü ve video token’larının otoregresif (AR) alt dizisini işleyen bir akıl yürütme kulesi; ve görüntüler, videolar, ses ve eylem için gürültülü gizli token’ları içeren difüzyon (DM) alt dizisini yöneten bir üretici kulesi. Kuleler, DM token’larının tüm AR token’larına çift yönlü olarak dikkat edebildiği, AR token’larının ise nedensel olarak kendine odaklanmaya devam ettiği çift akışlı ortak dikkat aracılığıyla etkileşir. Bu tasarım, önceden eğitilmiş görsel‑dil modelinden miras alınan otoregresif dil üretim performansını korurken, modaliteler arasında yüksek doğrulukta difüzyon sağlar.

Mutlak Zamansal Modülasyon ile Konum Gömme

Cosmos 3 Omnimodal World concept

Mimari, her token’a zaman, yükseklik ve genişlik koordinatı atayan 3‑D çok modlu RoPE (MRoPE) şemasını benimser. AR token’ları için koordinatlar standart MRoPE desenini izlerken, DM token’ları için sistem modaliteler arasında fiziksel zamanı eşleyen mutlak bir zaman ekseni tanımlar. Çerçeve hızları, 24 FPS referansından türetilen temel bir zaman adımıyla modüle edilir; böylece 30‑fps klip ve 16‑fps klip zaman çizelgesinde orantılı olarak ölçeklenmiş konumlar kapar. AR ve DM alt dizileri arasında on beş binimlik sabit bir zaman boşluğu eklenir, bu da görüntü üretimi sırasında dama tahtası (checkerboard) deseni artefaktlarını önler.

Modaliteler Arası Eylem Temsili

Cosmos 3 Omnimodal World - Modaliteler Arası Eylem Temsili

Yazarlar, üç bileşeni birleştiren tek bir eylem vektörünü tanımlar: ego konumu (göreceli kamera veya beden çerçevesi), etken konumu (son etken veya el konfigürasyonu) ve kavrama durumu. Her bileşen 3D çeviri ile birlikte 6‑D rotasyon temsili olarak kodlanır; sözde‑eylemler (pseudo‑actions), ardışık SE(3) konumları arasındaki farklardan türetilir, böylece beden‑spesifik kontrolör ayrıntılarından kaçınılır. Alan‑bilinçli giriş ve çıkış projeksiyon katmanları, her bedenin yerel eylem uzayını paylaşılan gizli eylem boyutuna eşler; eğitim sırasında bu projeksiyonlar MoT omurgasıyla birlikte optimize edilir.

Akıl Yürütme ve Üretim İçin Eğitim Düzeni

Cosmos 3 Omnimodal World illustration

Takım, Cosmos 3’ün akıl yürütme katmanını 22 milyon çiftli görüntü‑metin ve video‑metin örneği üzerinde iki aşamalı bir boru hattıyla önceden eğitir. İlk olarak, anlamsal yinelenme, çok modlu sohbetleri ortak gömme ile kümeler; kosinüs benzerliği 0.95’in üzerindeki yakın kopyalar elenir. İkinci adımda, Gemma‑4‑31B‑it görsel‑dil modelinden oluşturulan bir AI hakimi, her örneği doğruluk, tamlık ve uyum açısından puanlayarak yalnızca üç boyutta da en az 2 puanı alanları tutar. Elde edilen korpus %42.9 OCR, %16.5 2D yerleştirme, %11.3 görsel Soru‑Cevap içerirken başlıklandırma, akıl yürütme ve talimat‑takip verilerinin daha küçük paylarını da barındırır.

Üretici Çok Aşamalı Müfredat

Cosmos 3’ün üretici katmanı ilerleyici bir müfredatla eğitilir. Ön eğitim aşamasında gürültülü gizli token’lardan görüntü, video ve sesleri yeniden oluşturmayı öğrenir: 767 milyon görüntü ve 347 milyon video klip, 256p, 480p ve 720p çözünürlüklerde sabit bir 74 000 token bütçesiyle örneklenir. Orta eğitimde, egosentrik hareket, otonom araçlar, robotik ve kamera kontrolü olmak üzere dört fiziksel yapay zeka ekseninden alınan eylem token’ları tanıtılır ve kenar veya derinlik kontrollerini RGB çıktısına eşleyen kontrol‑koşullu üretim (“video transfer”) eklenir. Sonraki eğitimde model, Cosmos3‑Super‑Text2Image, Cosmos3‑Super‑Image2Video ve Cosmos3‑Nano‑Policy‑DROID gibi belirli görevler için kompakt seçilmiş veri setleriyle ince ayar yapılır.

Fiziksel Yapay Zeka İçin Sentetik Veri Setleri

Yazarlar, SDG çatısı altında beş sentetik veri koleksiyonu yayımlıyor: SDG‑PhyxSim (katı‑vücut çarpışmaları ve akışkan dinamiği), SDG‑RobotSim (altı ila sekiz robot bedeninde manipülasyon), SDG‑DriveSim (otomatik sürüş senaryoları), SDG‑SynHuman (dijital insan etkileşimleri) ve SDG‑Warehouse (insan‑forklift güvenliği). Bu veri setleri yüksek frekanslı kontrol sinyalleri ve web ölçeğinde ön eğitim korpusunda düşük temsil edilen nadir sahne kompozisyonları sunarak Cosmos 3’ün fiziksel olarak dayalı dinamikler ve sağlam eylem öncüllerini öğrenmesini sağlar.

En Gelişmiş (State‑of‑the‑Art) Performans

Cosmos3‑Super, geniş bir görev setinde uzmanlaşmış temel modelleri sürekli olarak geride bırakır. Bildirilen metriklere göre 91.36’lık bir skorla metin‑den‑görüntü üretiminde Artificial Analysis’in açık kaynaklı lider tablosunun zirvesine oturur ve RoboArena’nın bedenli robotlar için benchmark’ında en iyi politika skorunu elde eder. Qwen3‑VL‑8B mimarisinden uyarlanan Cosmos3‑Nano, görsel akıl yürütme ve video üretiminde benzer açık modelleri eşler ya da aşar ve bunu Super varyantından daha küçük bir ölçekte gerçekleştirir.

Açık Kaynak Yayın ve Topluluk Etkisi

Kod tabanı https://github.com/nvidia/cosmos adresinde bulunur; kontrol noktaları HuggingFace’da Cosmos3‑Super, Cosmos3‑Nano, Cosmos3‑Super‑Text2Image, Cosmos3‑Super‑Image2Video ve Cosmos3‑Nano‑Policy‑DROID adlarıyla mevcuttur. Sentetik veri setleri ve değerlendirme benchmark’ları HuggingFace veri setlerinde (SDG-PhyxSim, SDG-RobotSim vb.) barındırılırken proje web sitesi eğitim boru hattını yeniden üretmek için dokümantasyon sunar. OpenMDW‑1.1 lisansı dağıtımı izin verir ancak atıf gerektirir; NVIDIA tüm kontrol noktalarını topluluk araştırması için açık hale getirmiştir.

Sınırlamalar ve Kanıt Boşlukları

Değerlendirme büyük ölçüde simüle edilmiş verilere odaklanmıştır; gerçek dünya robotik dağıtım sonuçları henüz rapor edilmemiştir, bu da yüksek hızlı kontrol döngüleri veya güvenlik kritik etkileşimler için kanıt eksikliğine yol açar. Eylem tahmini yalnızca ayrık simülasyon eylemlerine sınırlıdır ve sürekli düşük seviyeli kontrolör entegrasyonu yoktur. Ayrıca modelin çok uzun video ufukları (yüzlerce saniye) üzerindeki performansı, eğitim sırasında kullanılan 400 kare sınırının ötesinde benchmarklanmamıştır.

Cosmos 3 Model Ailesi ve Açık Sorular

Super ve Nano varyantlarının yanı sıra model ailesi, Qwen3‑VL ağırlıklarından başlatılmak yerine sıfırdan eğitilen 2 milyar parametreli yoğun bir transformer olan Cosmos3‑Edge’i de içerir; bu, akıl yürütme-üretici tasarımını koruyan daha hafif bir dağıtım seçeneği sunar. Makalenin kendi ortaya koyduğu açık soru, Cosmos 3’ün birleşik eylem temsilinin gerçek robotlarda yüksek seviyeli politika üretimi ile düşük seviyeli donanım yürütme arasındaki boşluğu kapatıp kapatamayacağıdır; bu, gerçek dünya denemeleri rapor edilene kadar yanıtsız kalır.

Yorum bırakın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

HakkımızdaGizlilik PolitikasıYasal Uyarıİletişim▶ YouTube
✉ talktendertechx@gmail.com
Scroll to Top