泡泡资讯网

小鹏发布全新视觉模型,覆盖智驾座舱机器人全场景

今年上半年,小鹏集团密集发布了物理AI技术报告,包含多视角生成式世界模型X-World、世界模型推理加速引擎X-Cache、预测式世界模型X-Foresight及X-Mind技术框架。近日,小鹏又正式发布TuringViT高效视觉编码器,面向VLM/VLA时代,系统性重构视觉编码器的架构设计、数据范式与训练流程。

据了解,视觉编码器是物理AI的“感知入口”,所有场景理解、状态判断、动作决策的第一步都始于高质量的视觉特征提取。但随着VLM与VLA技术快速向真实场景落地,高分辨率图像、多视角输入、连续视频帧成为常态,行业对视觉编码器的要求正在发生本质变化。

当前主流技术路线普遍面临算力成本、数据效率、场景适配三重普遍瓶颈,行业普遍采用的“复用开源通用ViT”方案,已难以匹配智能驾驶、具身机器人等真实场景对性能、延迟与定制化的综合需求。针对上述行业痛点,小鹏提出了TuringViT这一系统性解决方案。

据介绍,TuringViT从架构、数据、训练三个维度同步突破,打造了“线性注意力主导+高质量数据治理+原生动态分辨率”的完整技术体系,实现了效果、效率与落地性的三重提升。在数据效率方面,TuringViT仅用0.85B图文对(约为主流模型训练数据规模的10%),便在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越使用10B数据训练的主流开源基线;在COCO、Flickr30K图文检索任务上也实现了“十分之一数据,更优效果”的突破。

TuringViT的发布,让小鹏全栈自研的物理AI底层技术能力逐步完善和丰富,这也不仅仅会服务于智能辅助驾驶,更将赋能更多物理AI业务场景。

在智能驾驶领域,TuringViT是第二代VLA系统的核心视觉编码器,其近线性的延迟特性,让高分辨率视觉感知得以在车端算力约束下稳定运行,助力窄路通行、无导航辅助驾驶、复杂路口处理、长尾交通参与者识别等功能的体验升级;进一步释放端侧大模型的性能潜力,让驾驶决策既“看得清”又“反应快”。

智能座舱与驾泊一体化场景,TuringViT的VLM原生特性让视觉特征与语言模型实现更高效的对齐,可以提供更高的识别精度、不同画幅和比例的视觉输入,以支撑更多未来的车辆与用户交互的丰富座舱功能。

在小鹏IRON人形机器人的技术体系中,TuringViT充当着“视觉视网膜”的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。统一的基座架构让智能驾驶场景积累的海量视觉经验能够快速迁移到机器人场景,大幅降低跨场景研发成本。

TuringViT的价值不止于小鹏内部业务的落地,为行业提供了一条可复现、低成本训练SOTA级(State-of-the-Art,最新技术水平)视觉Transformer的技术路径,推动先进视觉大模型从“头部团队专属”走向“行业普惠”。

小鹏集团表示,未来,将持续扩大高质量图文视频数据规模,深化时序建模与具身视觉方向的技术探索,推动视觉基座与VLM/VLA系统的更深度融合,让先进AI技术真正渗透到每一次出行、每一个交互场景,以科技突破定义智能出行与具身智能的新高度。

采写:南都·湾财社记者陈镜安