
Xiaomi Open-Sources Embodied Generative Large Model U0 to Mass-Produce Data for Robots
小米將大模型能力進一步推向機器人領域。 7 月 15 日,小米正式發佈並開源具身生成模型 Xiaomi-Ro…
小米將大模型能力進一步推向機器人領域。
7 月 15 日,小米正式發佈並開源具身生成模型 Xiaomi-Robotics-U0(以下簡稱 “U0”)。該模型擁有 380 億參數,將具身世界建模與通用圖像生成能力統一在一套多模態自迴歸架構中,主要用於生成、遷移和擴增機器人訓練數據。
U0 的目標是為機器人 “造數據”。
機器人要學會抓取、搬運、整理等動作,需要在大量不同場景中反覆訓練。但現實世界的數據採集成本高、週期長,危險、極端以及低頻場景也難以充分覆蓋。
U0 試圖把這一過程變成可批量運行的數據生產線。已有的機器人真機數據可以直接更換物體、光照、材質和背景,而不必重新搭建場景、部署設備並重復採集;現實中難以獲取的長尾場景,也可以通過模型直接生成。
U0 還提出 FlashAR+ 高速推理加速方案,通過對角並行解碼與緩存調度技術,將一張 1024×1024 分辨率的高清訓練圖片生成時間,從 450.77 秒壓縮至 5.44 秒,效率提升 82.9 倍。
這意味着,機器人公司可以在較短時間內,批量生成覆蓋不同背景、光照、物體等訓練數據。
U0 將具身場景生成、具身軌跡遷移、機器人交互視頻生成,以及通用文生圖和圖像編輯四類任務統一在一個模型中,基本貫通了 “生成場景—遷移軌跡—擴展環境—生成交互過程” 的數據生產鏈路。
事實上,類似的開源嘗試已經開始在具身智能行業出現。2025 年 3 月,羣核科技開源空間理解模型 SpatialLM。該模型可以將視頻或點雲轉化為包含牆體、門窗、傢俱及空間關係的結構化 3D 場景,企業可以針對自己的場景進行微調,用於提升機器人對物理空間的理解能力。
當前,具身智能行業仍面臨訓練數據不足、場景覆蓋有限和研發成本較高等問題。開源模型無法完全替代真機數據,也無法解決機器人與現實環境之間所有複雜的物理交互,但可以在一定程度上降低數據擴充和模型訓練的成本,加快機器人從實驗室走向工廠、倉庫和家庭等真實場景。
