
XPeng Completes the Visual Foundation of Physical AI
覆蓋智駕座艙機器人全場景。
7 月 21 日,小鵬集團稱,正式發佈 TuringViT 高效視覺編碼器,面向 VLM(視覺語言模型)/VLA(視覺語言動作模型)應用場景,從架構設計、數據範式與訓練流程進行了系統性重構。小鵬方面稱,該編碼器將用於小鵬智能駕駛、智能座艙及 IRON 人形機器人三大業務場景。
在 VLM/VLA 系統中,視覺編碼器通常被視為物理 AI 的 “感知入口”,負責將圖像或視頻轉化為供後續語言、動作模塊處理的視覺特徵。
隨着 VLM/VLA 技術向真實場景落地,高分辨率圖像、多視角輸入和連續視頻幀對視覺編碼器的效率與時序處理能力提出了更高要求。
小鵬方面認為,行業普遍採用的 “複用開源通用 ViT” 方案,難以同時滿足智能駕駛、具身機器人等場景對性能、延遲與定製化的需求。
小鵬將 TuringViT 的設計歸納為三個維度。
架構方面,TuringViT 以 Turing 線性注意力(TLA)為主,並保留少量標準多頭注意力,構成混合 Turing Block 架構;在高分辨率輸入下,計算複雜度由二次方縮放轉為近線性。
據小鵬公佈的測試數據,在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量達到 Seed1.5-ViT 的 3.04 倍。
該編碼器提供兩個規格版本:TuringViT-18L 包含 3 組 Turing Block,面向動態分辨率下的部署;TuringViT-24L 包含 4 組 Turing Block,側重提升表徵能力。
數據方面,TuringViT 採用 VISTA-Curation 多模態數據治理流水線。據小鵬方面介紹,該流水線對圖文和視頻數據進行多階段篩選、重新描述和評分,以提高單個樣本的監督信息量。TuringViT 使用 0.85B 圖文對進行預訓練,約為 SigLIP2-L 訓練數據規模的 10%。在包括 ImageNet-1K 在內的六項零樣本分類基準上,TuringViT-24L 的平均準確率為 83.6%。
訓練方面,TuringViT 採用四階段漸進式原生動態分辨率訓練方案,從預訓練階段即適配下游 VLM/VLA 的輸入特性,配合二維旋轉位置編碼,支持不同尺寸和長寬比的輸入。小鵬方面表示,這一設計減少了對 “固定分辨率預訓練 + 事後適配” 路徑的依賴。
小鵬方面稱,TuringViT 將用於三類業務場景。
在智能駕駛領域,小鵬稱 TuringViT 是第二代 VLA 模型的核心視覺編碼器,負責處理多路環視攝像頭的高分辨率圖像和多幀動態道路場景輸入,為預測式世界模型提供視覺 token。
在智能座艙場景中,TuringViT 的 VLM 原生特性用於對齊視覺特徵與語言模型,並支持不同畫幅和比例的視覺輸入。
在小鵬 IRON 人形機器人的技術體系中,小鵬將 TuringViT 定位為基礎視覺模塊,承擔物體識別、空間關係理解、可操作區域檢測和動態環境追蹤等功能。
何小鵬在 3 月 20 日業績會上稱,小鵬 IRON 人形機器人計劃於 2026 年底量產,年底月產能目標為上千台,並將優先在小鵬門店落地商用。
小鵬方面表示,TuringViT 的架構設計與訓練流程不依賴特定硬件平台,可為行業提供一條可復現的視覺大模型訓練路徑。
從技術佈局看,TuringViT 補上了小鵬物理 AI 技術體系中的視覺編碼器一環。
此前,小鵬已陸續披露多視角生成式世界模型 X-World、世界模型推理加速引擎 X-Cache、預測式世界模型 X-Foresight 及 X-Mind 技術框架。TuringViT 則位於這套物理 AI 技術體系的感知輸入端。
不過,視覺編碼器從技術發佈到實際場景的規模化落地,仍要經過工程適配、算力部署與場景驗證。
TuringViT 能否在車端、座艙和機器人三個差異化的物理環境中穩定運行,尚需持續觀察。小鵬方面表示,未來將持續擴大高質量圖文視頻數據規模,深化時序建模與具身視覺方向的技術探索。
