总1 关键结论:通用大模型GPT-6 Astra已经能控制真实丰田卡罗拉在停车场跑完134.7米,但这是封闭低速实验,不是真正驾照考试,也不等于能上路自动驾驶。
1.四款模型对比中,Astra是唯一完成全程的模型;Claude Fable 5.1最好成绩为45%,Grok 4.6为11%,GPT-5.6 Sol为6%。
2.Astra第二次尝试用时5分22秒,平均速度约0.42米/秒,相当于每小时约1.5公里,开得非常慢。
总2 实操启发:大模型不重新训练也能靠第一次的失败经验调整驾驶策略,但使用时安全边界仍要重视。
1.Astra第一轮只跑67.3米、完成约49%,复盘后把速度控制在0.8米/秒以内,并在24次运动指令中20次使用100%转向,最终完赛。
2.模型会通过摄像头和MCP工具观察环境、设定方向与速度、立即停车,再经openpilot控制车辆,本质上是驾驶大脑。
3.测试场地封闭、速度上限3.5米/秒、每模型只测一组、摄像头有盲区,因此普通用户不能把它等同于成熟智驾功能。
总1 产品研发:通用大模型展示出理解真实环境并操作物理设备的能力,给品牌做智能化产品提供了一条不一定需要专用模型的路径。
1.GPT-6 Astra通过摄像头视觉信息、MCP工具与底层控制系统形成感知到执行的闭环,完成134.7米真车路线,说明大模型可以充当智能硬件的中枢大脑。
2.它没有针对驾驶重新训练,而是依据第一次失败信息在第二次调整速度与转向,体现上下文学习对产品体验改进的价值。
总2 消费趋势与用户认知:安全、成本和真实场景限制会直接影响消费者对AI开车的信任。
1.模型最初会因安全理由拒绝控制真车,把工具改名为“DrivingBench Sandbox”后拒绝现象减少,说明安全边界和提示词诱导都是产品设计需要面对的问题。
2.测试速度很慢,平均仅0.42米/秒,一次试驾消耗约660万token、成本约7.74美元;品牌若把大模型能力作为卖点,要避免让消费者为概念支付过高溢价。
3.这次成绩不能和城市NOA、Robotaxi直接比较,品牌更值得关注的是通用大模型在未来物理世界操作能力上的储备,而不是马上量产装车。
总1 增长机会:通用大模型开始操作真实车辆,提示AI应用从电脑任务扩展到物理世界,卖家可关注这类能力带来的新服务和新产品机会。
1.DrivingBench让GPT-6 Astra等模型通过摄像头和标准工具控制一辆丰田卡罗拉,Astra唯一完赛,说明大模型可以作为低门槛的物理操作大脑。
2.测试按token消耗计费:完赛134.7米约用660万token、成本7.74美元,这种成本结构让实体场景的AI服务有了可量化测算。
总2 风险与应对:目前还处于实验期,不能把能开真车等同于可商用。
1.测试在封闭停车场进行,没有机动车、行人、交通信号灯,速度上限3.5米/秒,每模型实际只测一组连续上下文,样本量不足。
2.模型存在安全拒绝、摄像头盲区和对近处障碍物不敏感等局限,直接投入交付业务风险高。
3.可从Astra第一次失败后主动降低速度、增加转向幅度的操作中学习:先在小范围、低速、有安全员和人工干预的“沙盒”场景试错,再逐步扩大应用。
总1 产品设计与硬件需求:这次真车测试展示了接入大模型控制所需的硬件链路,工厂在做智能设备时需注意接口兼容与传感器配置。
1.测试车辆通过comma four设备、OBD-C接口接入CAN总线,底层控制建立在openpilot上,说明未来AI驾驶相关产品需要预留标准化数据接口和线控执行能力。
2.模型通过前视摄像头观察环境,但摄像头有明显盲区,难以看到近距障碍物、车辆两侧和后方,这给传感器布置和周边视场补全提出明确需求。
总2 商业机会与数字化启示:大模型正在成为物理世界的控制大脑,工厂可从中看到智能硬件和自动化改造的机会。
1.GPT-6 Astra并不直接生成方向盘扭矩或制动压力,而是通过观察环境、设定方向速度、立即停车这些标准工具指令控制车辆;这种大模型大脑加底层执行的分工,给控制器、执行器、传感器等供应链带来配套空间。
2.Astra在第一次失败后通过上下文复盘,第二次调整速度与转向策略,无需重新训练参数;产线数字化可借鉴这种利用运行数据持续优化策略的方式。
3.但测试仍处于封闭低速演示阶段,工厂如果要投入相关产品,应先小批量验证,不要按成熟量产依据。
总1 行业趋势与新技术:通用大模型进入真实物理设备控制,是本轮具身智能和物理AI趋势中的重要信号。
1.DrivingBench测试了GPT-6 Astra、Claude Fable 5.1、Grok 4.6和GPT-5.6 Sol,只有Astra完成134.7米赛道,说明不同基础模型在真实驾驶任务上的表现差异很大。
2.技术架构是模型理解加MCP工具调用加openpilot执行,实现了观察环境、设定方向与速度、立即停车等能力,模块化程度较高,容易被复制到其他机器人场景。
3.Astra第一轮失败后没有重新训练,而是在同一上下文里复盘,第二轮把速度降到0.8米/秒以下并增加转向幅度,展示了上下文学习在物理控制中的价值。
总2 客户痛点与解决方案:安全、成本和稳定性是当前客户最需要被解决的三个问题。
1.模型最初会因安全原因拒绝执行,工具改名“DrivingBench Sandbox”后拒绝减少;服务商要帮助客户构建真正的操作边界,而不是依赖名称和提示词规避。
2.当前方案平均速度约0.42米/秒,一次驾驶消耗约660万token、约7.74美元,效率与成本都还达不到实时产品级自动驾驶要求。
3.可以提供的配套服务方向包括:封闭场地基准测试、多模型能力评估、传感器盲区补全、安全员干预流程和失败归因优化。
总1 平台机会与做法:第三方实验把一个原本面向电脑操作的大模型推向真车驾驶,说明模型平台应主动挖掘物理世界应用场景。
1.OpenAI发布GPT-6 Astra时主要强调计算机操作、浏览器、软件工程和科学研究,并未提汽车驾驶;但DrivingBench证明它可通过MCP工具控制真实车辆,这给平台拓展开发者生态带来新方向。
2.平台可把观察环境、设定方向与速度、立即停车等动作标准化为可调用的工具接口,让车企和开发者更容易接入底层执行系统。
总2 运营管理与风险规避:物理操作比文本任务风险高,平台需要在能力开放、计费和风控上更谨慎。
1.模型对真实车辆有安全拒绝行为,但把工具命名为“DrivingBench Sandbox”后拒绝减少,平台要防止通过命名或描述诱导模型绕过安全限制。
2.四款模型成绩差异明显,分别为完赛、45%、11%、6%,说明需要实体场景基准测试来筛选和运营模型能力,不能只看演示效果。
3.一次驾驶消耗约660万token、成本约7.74美元,且速度只有0.42米/秒;平台设计配额、计费和开发者扶持政策时,要考虑到高token消耗任务的经济性。
总1 研究命题:实验验证了通用大模型能通过真实车辆形成感知、判断、规划、控制闭环,是基础模型进入物理世界的样本。
1.四款模型中GPT-6 Astra唯一完成134.7米,Claude Fable 5.1、Grok 4.6、GPT-5.6 Sol最好成绩分别为45%、11%、6%。
2.系统用comma four、OBD-C、CAN总线、openpilot和MCP工具连接,大模型观察环境、设定方向速度、停车,底层执行交给传统系统。
总2 新问题与启示:上下文学习、安全边界和样本不足是研究重点。
1.Astra第一次失败后在同一上下文复盘,第二次把速度上限降到0.8米/秒并在24次指令中20次使用100%转向,说明不重训也能优化物理控制策略。
2.模型最初拒绝控制真车,工具改名“DrivingBench Sandbox”后拒绝减少,提示表面因素可能影响模型对现实后果的判断,带来安全治理课题。
3.实验局限很大:封闭停车场、无交通参与者、限速3.5米/秒、每组一次连续测试、摄像头有盲区;其意义不是替代自动驾驶,而是证明通用模型逐步获得物理世界操作能力,为世界模型和具身智能研究提供参照。
返回默认