小鹏发布TuringViT视觉编码器:自研ViT打通智驾、座舱与人形机器人三大场景
7月21日,小鹏在IRON人形机器人量产倒计时阶段发布专有视觉编码器TuringViT,两个版本覆盖智能驾驶、智能座舱与IRON三条业务线。这并非独立CV课题,而是VLA 2.0统一架构的视觉前置。同日,澳大利亚财经评论披露小鹏计划2027年在澳经销商试点IRON,将技术发布嵌入具体的全球化时间表。
在1536×1536分辨率下,TuringViT-18L吞吐量达Seed1.5-ViT的3.04倍、SigLIP2-ViT-L的2.16倍;训练仅用8.5亿图像-文本对,6个zero-shot基准平均83.6%,超越在100亿样本上训练的开源基线。TMTPost将其概括为“系统性重构视觉编码器架构、数据范式与训练流程”,为VLM/VLA时代提供低延迟实时管道。在机器人场景,该管道对接IRON的720°鹰眼视觉系统和4D毫米波雷达融合感知。
小鹏已构建“芯片—算子—模型”全链路闭环,机器人是这一体系最完整的承载体。IRON搭载3颗自研图灵AI芯片,端侧算力2250 TOPS;VLA 2.0模型参数量比上一代提升10倍,训练数据近1亿clips,同一模型可驱动AI汽车、飞行汽车和人形机器人。跨域复用使智驾视觉表征直接产生机器人动作指令,无需语言转译。何小鹏称机器人品质要求“甚至高于车规”,既指82至84关节的可靠性,更指感知-决策-执行链路必须达到车规级实时性与一致性。
2026年2月,广州广棠科创城具身智能产业园开工,总建筑面积约11万平方米,目标年底月产上千台。5月,首台车规级ET1原型落地,第八代即首款量产机型完成定义。然而硬件瓶颈比AI更真实:米良川4月坦承过往失败几乎全源于一根小线束或信号断连,早期灵巧手在工厂测试中寿命不足一个月,第二代灵巧手仍在多路径并行研选。84关节架构、全固态电池5C快充、0.01毫米指尖反馈精度等参数看似领先,但生产一致性才是即将面临的真正考题。
商业场景的选择进一步放大了视觉能力的重要性。IRON优先切入导览、导购、导巡,而非工厂“拧螺丝”,因为何小鹏早就判断人形机器人在工厂任务中机械手损耗快、成本高。2025年,IRON已在小鹏P7+产线完成单日500颗螺丝安装实训,并在部分门店提供引导、递水服务。2026年6月内部信明确2027年Q1进入门店担任销售助理,Q2推向海外市场,澳大拉西亚经销商试点恰坐落于此节点。对于需在真实零售环境中理解人类意图并作出实时反应的机器人,低延迟、高吞吐且与智驾共享表征的视觉系统是入场券,而非锦上添花。
数据策略上,TuringViT的8.5亿图文对训练集是跨域视觉表征的起跑点。小鹏已在广州建设专用具身智能数据工厂,内部相信scaling laws对机器人同样有效,但拒绝披露具体采集的数据类型。播客中Sean Shi强调“数据形态决定产品形态”,人形之所以必要,正因人类数据训练指向类人动作。过去一年的工程实践表明,从工厂到门店,真实场景产生的多样性远非仿真环境可覆盖,高效视觉编码器的价值将在增量数据飞轮中被反复放大。
TuringViT 的真正价值不在 CV 刷榜,而在于它让小鹏机器人的 VLA 2.0 架构首次拥有了一个与智驾在像素级共享表征的视觉入口。
- 🔗 TechNode ↗
- 🔗 AFR ↗
- 🔗 TMTPost ↗
- 🔗 botinfo.ai ↗
- 🔗 stcn.com ↗
- 🔗 ne-time.cn ↗
- 🔗 xiaopeng.com ↗
- 🔗 humanoidsdaily.com ↗
- 🔗 finance.sina.cn ↗
- 🔗 21jingji.com ↗
- 🔗 guancha.cn ↗
- 🔗 cnevpost.com ↗
- 🔗 pdf.dfcfw.com ↗
- 🔗 youtube.com ↗
- 🔗 RobotScope 档案 · 小鹏机器人 ↗