Generując syntetyczne dane, 38-miliardowy model zwiększa skuteczność fizycznego robota w trudnych zadaniach z 36,9% do 63,2%. 🤖

Xiaomi-Robotics-U0 to 38-miliardowy model fundacyjny świata, traktujący generowanie ucieleśnione jako rozszerzenie klasycznych modeli generatywnych. W jednej architekturze łączy tekstobraz, edycję, generowanie scen 3D i wideo, zachowując spójność wielowidokową, geometrię oraz dynamikę interakcji. Model nie tylko tworzy fotorealistyczne środowiska dla różnych robotów, ale wprowadza strukturalny transfer - drobnoziarnistą edycję z zachowaniem fizyki. Kluczowa funkcja: działa jako skalowalny
uzior - Generując syntetyczne dane, 38-miliardowy model zwiększa skuteczność fizyczne...

źródło: card

Pobierz
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

Robot w zagraconym pomieszczeniu zawodzi zwykle nie z powodu braku ścieżki, ale źle dobranego marginesu bezpieczeństwa. 🛠️🤖

Planery dyfuzyjne generują z kamery RGB-D wiele propozycji trajektorii, dotąd jednak nie było dobrego sposobu, by wybrać tę z adaptacyjnym prześwitem. Badacze proponują kontekstowego krytyka bezpieczeństwa, rozkładając ranking na trzy składniki: karę za budżet prześwitu z resztą funkcji bariery sterowania dla bezpieczeństwa w punktach trasy i przejściach, karę za gładkość i objazdy odciętą bramką bezpieczeństwa oraz
uzior - Robot w zagraconym pomieszczeniu zawodzi zwykle nie z powodu braku ścieżki, a...

źródło: card

Pobierz
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

Robot po treningu wyłącznie na danych zebranych bez udziału fizycznego robota osiągnął 85% skuteczności w precyzyjnym zadaniu wkładania. 🤖🛠️

Zespół Simple AI zbudował system HiFi-UMI - przenośny zestaw kamer i czujników, który rejestruje demonstracje manipulacji z dokładnością 3 mm dla końcówki roboczej, bez zewnętrznego systemu śledzenia. Kluczowe okazały się: stereoskopowy SLAM montowany na głowie, synchronizacja GPIO na poziomie mikrosekund oraz dwie szerokokątne kamery na dłoń (łącznie ~200 stopni pola widzenia). Polityka wytrenowana wyłącznie
uzior - Robot po treningu wyłącznie na danych zebranych bez udziału fizycznego robota...

źródło: card

Pobierz
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

Roboty uczą się rozumieć obiekty w 3D, nie używając żadnych sensorów głębi. 🤖🛠️

Nowa metoda treningu modeli VLA (wizja-język-akcja) każe im internalizować strukturę przestrzenną przedmiotów wyłącznie na podstawie obrazu 2D. Podczas treningu wykorzystuje się SAM3D jako zamrożonego nauczyciela - lokalizuje on obiekty, tworzy maski i wyciąga gęste, trójwymiarowe reprezentacje celu. Są one wpasowywane w cechy wizualne modelu π₀, który uczy się działać tak, jakby widział głębię. W testach na LIBERO osiągnięto 99,1%, a
uzior - Roboty uczą się rozumieć obiekty w 3D, nie używając żadnych sensorów głębi. �...

źródło: card

Pobierz
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

Nowa architektura sterowania pozwala robotom reagować na dotyk 4 razy szybciej niż dotychczasowe modele, bez utraty zdolności przewidywania ruchu. 🛠️🤖

Polityki oparte na dużych modelach przewidują akcje, ale nie reagują w trakcie ruchu - potok percepcja-akcja jest za wolny. πR² rozdziela wejście na szybką propriocepcję i wolną wizję, a akcję generuje w jednym kroku odszumiania. Replanuje dzięki temu ~25 Hz (4× szybciej), z reakcją co 40 ms. Wzrost skuteczności: +23% w symulacji, +30%
uzior - Nowa architektura sterowania pozwala robotom reagować na dotyk 4 razy szybcie...

źródło: card

Pobierz
  • 2
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

Nowa architektura sterowania robotem przewyższa model OpenVLA o 18%, wykorzystując zaledwie 0,7% jego parametrów. 🛠️🤖

Współczesne polityki sterowania zwykle kompresują obserwację do jednego tokena, tracąc szczegóły przestrzenne. Zespół z New York University, z udziałem Yanna LeCuna, proponuje Patch Policy - lekkie rozszerzenie architektury transformerów. Wykorzystuje maskę blokowo-przyczynowej uwagi, by model bezpośrednio konsumował gęste tokeny z wstępnie wytrenowanego ViT. Daje to 40% relatywną poprawę nad reprezentacjami typu global-pooling. (preprint, oczekuje recenzji)

Pozwala to na wykorzystanie
uzior - Nowa architektura sterowania robotem przewyższa model OpenVLA o 18%, wykorzys...

źródło: card

Pobierz
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

Ceramiczny pierścień o grubości ludzkiego włosa zastępuje skomplikowane, wieloelementowe sensory siły. 🛠️⚗️

Opracowano monolitowy, 6-osiowy czujnik siły i momentu z pojedynczej, ultracienkiej powłoki piezoceramicznej. Eliminuje wielokomponentowy montaż i żmudną kalibrację, wykorzystując naturalne mody deformacji. Dokładność odsprzęgnięcia sięga 99,37% w 120 000 testów dynamicznych. Pierścień o grubości 50 μm osiąga granice detekcji: <3 mN siły normalnej, <4 mN stycznej, <0,3 mN·m momentu. Cały czujnik waży 3,85 g i mieści 2,53 cm³ (Nature Communications).

Integracja z
uzior - Ceramiczny pierścień o grubości ludzkiego włosa zastępuje skomplikowane, wiel...

źródło: card

Pobierz
  • 5
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

@uzior wynalezienie takich czujników to osiągnięcie i tego nie neguję. Ale to nie jest żadna "szansa dla robotyki", bo w robotyce nie to jest największym problemem.

Dlaczego przekraczasz to co piszę?
  • Odpowiedz
Wystarczy jedno nagranie, by robot natychmiast nauczył się złożonej manipulacji - bez żadnego treningu. 🤖

RoboTTT, model z NVIDIA i Stanford, łączy uczenie w czasie testu z politykami VLA, by przetwarzać 8K kroków kontekstu (1000× więcej niż dotąd) bez opóźnień. Daje to uczenie z pojedynczego nagrania, poprawę polityki na bieżąco i odporność. Wyniki: +87% vs baza, +62% vs 1K kontekst. Po raz pierwszy kończy 5-minutowe, 10-etapowe zadanie montażowe. (preprint, oczekuje recenzji)

Otwiera to drogę
uzior - Wystarczy jedno nagranie, by robot natychmiast nauczył się złożonej manipulac...

źródło: card

Pobierz
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach