智驾大模型开启西线新战事

原创 autocarweekly 2024-07-25 16:46

文|三少爷


是的,大模型正在悄悄入场!


就在自动驾驶行业的玩家正在端到端的赛道卷得锣鼓喧天的关键时刻,成为车企和方案供应商们又一个重要宣传抓手。


而经过一轮又一轮的技术传播,业界对端到端的概念、作用和实现方式逐渐达成一致,形成共识,但对于大模型则普遍语焉不详,甚至存在有意无意模糊大模型概念的现象。


有的厂商将之前的自动驾驶模型做得参数大了一些,就堂而皇之地称自己有的是自动驾驶大模型;有的厂商只是实验性、象征性地把大语言模型部署到车端上,没有真正实现端到端,也敢用“端到端大模型”的名义宣传。


当然也有真材实料的厂商秉持“悄悄的进村,打枪的不要”,保持着不可思议的低调。


不管怎样,大模型势不可挡地渗透进自动驾驶领域,成为引发第4次工业革命的大杀器。大模型到底可以给自动驾驶带来哪些价值?


云端大模型 加速开发闭环


也难怪华为总结说:大模型对自动驾驶开发闭环和数据闭环的赋能,主要体现在场景理解、预标注、多模态检索和场景生成这四个方面。


应该说,总结得比较全面了。


图片来源:华为


首先是场景理解。


记得毫末智行在去年的AI Day上展示过自家DriveGPT的场景理解能力,不仅具备目标识别、语义分割、行为预测等传统技能,还能理解场景中的复杂语义和行为逻辑。


不要觉得这个能力有多不可思议,背后原理就是大模型通过学习驾驶场景文本和图片模式的关联,逐渐学会“看图说话”。文本、图片是站在两个不同的视角下对同一个驾驶场景的描述,在驾驶场景这个“Fact”的纽带下,文本和图片可以自然而然地匹配起来。


它就像古人游山玩水之时触景生情诗兴大发,留下千古名句,让人不自觉地在美景(图片)和诗句(文本)之间建立起了关联——看到壮丽山河,“会当凌绝顶,一览众山小”;见到宁静湖泊,“水光潋滟晴方好,山色空蒙雨亦奇”。


而大模型喂进去上亿张图片和文本描述对之后,也会自然而然地触“景”(驾驶场景)生“情”(文本形式的Token),绝不会像那些肚子里没有多少唐诗宋词存货的人那样,看到美景只会说卧槽,感慨书到用时方恨少。


图片来源:毫末智行


而在数据标注方面。


业界一开始是通过计算机视觉进行数据的自动标注的,但这些传统算法的标注准确性不足,事后需要大量的人工矫正。


后来,利用基于卷积神经网络的深度学习模型,在大量已标注数据中学习了目标的特征和模式,建立出对新数据进行自动标注的能力。


这类深度神经网络模型不仅大幅度提高了数据自动标注的准确性,还可以把标注效率提升两三个数量级(和人工标注相比)。不过这种方式极其消耗算力。特斯拉在2022年的AI Day上曾透露:在训练占用网络的过程中,一共投入14,000张显卡,其中有4000张专门用作数据自动标注。


图片来源:特斯拉


大模型技术则进一步提高标注精度,提升标注效率,在一定程度上降低算力需求。2023年,Meta推出面向通用图像分割任务的视觉大模型SAM(Segment Anything Model),可以拿来进行驾驶场景的物体识别、分类、语义分割,大大加快了那些没有基础模型研发实力的智驾方案供应商和车企们,标注数据的速度。


图片来源:地平线


最后自动驾驶模型训练完成之后,需要“出考卷”验证模型的能力,“考卷”就是自动驾驶闭环仿真系统。


根据理想汽车的总结,搭建仿真系统有三条技术路线。第一,通过游戏引擎搭建3D虚拟场景;第二,利用车端数据,通过神经渲染重建场景;第三,通过生成式世界模型,直接生成全新的场景。


图片来源:理想汽车


当然,场景重建可以与AIGC相结合,在原有简单路况的基础上生成交通要素更丰富的场景。比如华为盘古汽车大模型可以在原始的空旷道路上通过Bbox增加车辆,生成可控交通流,提高场景的复杂度。



这里特别说一下小鹏汽车。


他们是利用生成式模型,在通过实车数据重建的动态视频中插入动静态物体,生成罕见的Corner case,用于加速长尾场景的收敛。


图片来源:小鹏汽车


车端大模型 辅助感知和决策


的确,进入二季度以来,自动驾驶行业陆陆续续传出大模型上车的消息。


比如5月AI DAY上,小鹏汽车就表示端到端大模型正式量产上车,将通过大模型识别潮汐车道、特殊车道、复杂左转区标志、路牌标识。


似乎说了等于没说啊……翻译一下就是:利用大语言模型的能力,加入了对文本类型信息的语义理解,用于辅助自动驾驶感知。


而特斯拉的6月股东大会上,马斯克在回答一名记者提问时表示,特斯拉FSD使用了大语言模型技术。


和小鹏汽车的模模糊糊,特斯拉的语焉不详形成鲜明对比——理想汽车在7月智能驾驶系统发布会上,正式且明确地推出了端到端+大模型(视觉语言模型VLM)的双系统方案,还比较详细地介绍了视觉语言模型的架构、能力和实际应用。


图片来源:理想汽车


模型架构上,理想汽车视觉语言模型DriveVLM的输入为传感器,输出中间决策结果(车速建议、车道建议等)后,输送给端到端系统1,再辅助最终的轨迹决策。


系统能力上,视觉语言模型具备对复杂环境的理解能力,可以读懂导航地图,理解交通规则。

实际应用中,它可以识别潮汐车道,给出禁行建议,检测公交标志牌上的限行时间。还能根据当前时间,给出是否使用公交车道的建议。甚至能发现道路光线不足和路面颠簸,给出相应的减速建议。


图片来源:理想汽车


结合理想汽车分享的颠簸路面建议减速的场景,我们可以大致模拟一下视觉语言模型的工作过程,应该是这样子滴:


DriveVLM输入传感器信息、导航信息和时间信息,持续不断地形成并更新对场景的理解,以一定频率向系统2发提示词:“请描述当前的场景、天气、时间、道路类型、备选车道、自车车道”。


系统2输出了包含这些信息标签的场景描述后,再向自己发送提示词:“在当前的坑洼路场景下,应该怎么办?”它认真思索了一下:“咱们不是真魔毯,可以减速一下,减少因路面坑洼造成的颠簸感。”


看起来是不是很聪明的亚子?


图片来源:蔚来汽车


端到端+大模型是不是自动驾驶的终局?


其实,在理想汽车发布端到端+视觉语言模型的双系统方案之后,有不少专家认为:理想居然拿一颗四五百美金的Orin X芯片做视觉语言模型,旨在开创一条全新技术路线,豪赌的意味颇为明显。


的确,能不能成为新技术路线的开创者,于理想和整个业界是有一定争议的。


一则,特斯拉是端到端方案的领路人,OpenAI是大模型技术的拓荒者,作为特斯拉、OpenAI的联合创始人,马斯克更有资格成为端到端+大模型的开创者。


二则,小鹏、特斯拉的端到端大模型同样使用了大语言模型技术。不过,小鹏XNGP只是在端到端方案中,使用大语言模型作感知模块的一个组件。而理想汽车的智驾系统里,视觉语言模型并不是端到端系统的一部分,而是与之并行的独立系统。


咦……从这个角度来看,理想的双系统方案确实开风气之先!


但是,更重要的争议点在于——现在就判断端到端+大模型会成为自动驾驶技术路线的终局,还早了一点。


特斯拉引领的BEV、占用网络和端到端,之所以成了业界追随的主流技术路线,是因为每一次技术方案的升级,都大幅度提升了自动驾驶系统的性能表现。而当前的大语言模型或视觉语言模型,并没有展现出这种实力。


毕竟,车端大模型依旧面临着三大问题。


一是大模型的幻觉问题。理想汽车的确展示了它在若干场景下的精确场景描述能力和到位的决策建议。但是,道路千千万,场景万万千,系统2是不是每次都能精准描述、建议到位了呢?


二是大模型的实时性问题。大模型要证明自己的能力,不能停留在只是输出对实时性要求不那么严格的中间规划结果上。而当需要直接输出行车轨迹规划时,按照任少卿在去年的蔚来科技日上的说法:决策模块需要在30毫秒之内给出规划路径。


目前理想视觉语言模型的延迟在300毫秒左右,和30毫秒差了整整一个数量级。


图片来源:理想汽车


三是大模型的成本效益问题。目前的端到端方案并没有完全释放自己的潜力,当端到端可以覆盖99%的场景时,即便将来通过英伟达雷神芯片解决了模型的实时性问题,用一颗价格八九百美金(Orin X的价格在400-500美金之间)的大算力芯片做大语言模型,覆盖剩下1%的场景,到底还具不具备成本效益呢?


写在最后


大模型可以在云端改造算法开发工作流,也已经在自动驾驶的数据闭环和开发闭环中,证明了自己的价值。但是,车端大模型依旧处于早期发展阶段。


或许,还得靠特斯拉完成对端到端+大模型技术路线的探索。


毕竟马斯克是在股东大会上明确表态了:特斯拉将在18个月之内推出第5代HW硬件,相较HW4,算力提升10倍,外加7000TOPS+的算力。这……会不会就是拿来跑大模型的呢?


autocarweekly 车不只是代步工具,还是生活的一种刻度。
评论
  • 在EMC测试过程中,传导发射(Conducted Emission,CE)超标是工程师最常遇到的问题之一。更令人头疼的是,同样的超标曲线背后,可能对应着完全不同的干扰机理:有的是差模噪声沿电源回路传播,有的是共模电流通过寄生路径耦合,还有些问题甚至并非来自电源本身,而是负载、电缆布局或接地结构引起的连锁反应。 · 150kHz~1MHz 超标:多为差模噪声为主,干扰沿火线-零线回路传输。 · 1MHz~30MHz 超标:通常共模噪声占主导,干扰通过火线/零线对地回路传播。 如果条件允许,用电流探
    誉磁电磁兼容EMC 2026-07-31 18:45 487浏览
  • 在芯片总成本中占比不到 1%,却可能因一处品质偏差导致整片晶圆报废——半导体切割/研磨胶带,正随着先进封装的爆发,成为封测产线选型中最谨慎对待的耗材之一。但鲜有人注意到,决定这层胶带性能上限的,是上游一层更薄的基膜。这个长期由日本企业主导的隐形环节,正在出现国产突围的信号。一、需求之变:先进封装与“韬定律”重塑胶带市场AI 算力芯片、HBM 高带宽存储、Chiplet 芯粒等先进封装产品持续放量,国内封测产线扩产节奏不减。作为晶圆减薄与切割工序的必需耗材,晶圆胶带的需求同步扩容。据 QYRese
    芯膜前沿 2026-07-31 16:35 357浏览
  •        很多人只见过封装在SMD外壳里的小尺寸晶振,却不知道一颗2016、1612甚至1210封装的微型石英晶振,从一块巴掌大的石英原矿,到最终能稳定起振的成品,要经过十几道精密工序。它内部的石英晶片厚度最薄不到20微米,比普通A4纸的1/5还薄,整个生产过程里哪怕0.1微米的误差,都会直接废掉整批产品,这也是小尺寸晶振过去长期依赖进口,国内厂商花了十几年才啃下量产硬骨头的核心原因。1. 原石定向切割:0.01度的角度误差都不能有小尺寸晶振的第一步,
    TKD泰晶科技 2026-08-07 08:43 282浏览
  •     长期专注WiFi领域,也算是行业老兵了!同行闲聊中,时不时能提起我和我们!从疫情起,国产替代风生水起,起起落落,大浪淘沙,生存下来的都是强者!    WiFi模块应用广泛,对于高端市场和特定市场,要求WIFI模块需要过CE/FCC之类的认证,也就是说没有认证的模块,不具备导入产品设计.接下来就和大家聊聊认证模块选型参考!    WIFi模块硬件方面主要考虑以下九点特性:    1
    纳拓科技 2026-07-31 17:56 239浏览
  • 文:杜杰编辑:侯煜当地时间7月28日,美国特朗普政府落地最新科技封锁政策,美国联邦通信委员会(FCC)正式更新《受管制清单》,新增两大类设备——境外生产的先进机器人设备、境外生产的联网电力逆变器。FCC在官方情况说明书中明确,该类境外制造产品,“会对美国国家安全或美国民众的人身安全构成无法承受的风险”。本次新规设置明确豁免机制:经美国国防部(DoW)、电力逆变器品类经美国国土安全部(DHS)审核并授予“有条件批准”,认定对应设备品类不存在重大安全风险,即可获得准入豁免。同时政策严格执行新老划断原
    华尔街科技眼 2026-08-03 21:28 312浏览
  • 产品使用18V供电,配套4串锂离子电池,需要设计一个充电器。因为输入18V,电池最高 16.8V,压差仅 1.2V。因为压差太小。使用开关型的充电控制芯片不稳定。尝试自行设计一个。整体采用分立三极管 + TL431架构,分4个功能单元:使能控制回路、限流环路、TL431 精密恒压反馈环路、PNP 功率管主功率输出回路;实现完整锂电池充电逻辑。使能控制回路按键按下:5V 电压经 R12 (2kΩ) 送入 NPN 管 Q3 基极,Q3 饱和导通,对地拉低 R1、R2 组成的分压控制节点电位;该节点直
    southcreek 2026-08-07 13:45 237浏览
  •                                                                        
    广州铁金刚 2026-08-06 17:44 58485浏览
  • 在前六期中,我们已经分别讨论了 CRA 的适用范围、整体影响、漏洞通报义务、风险评估与技术文档证据链、第三方组件与 SBOM 供应链治理,以及产品上市后的支持期、安全更新、用户说明和终止支持管理。到这里,企业已经能够回答几个核心问题:产品是否落入 CRA 适用范围,产品由哪些组件构成,企业如何证明自己在设计、开发和上市前采取了必要的安全措施,以及产品上市后如何持续维护和安全下线。但对于真正准备落地 CRA 合规的企业来说,还有一个更现实的问题:CRA 的法规条文相对原则化,企业应当如何把“网络安
    虹科云科技 2026-08-03 16:51 107705浏览
  • ​摘要:低价大流量卡正全面退市,政策收紧已成定局。面对传统号卡的不确定性,随身WiFi凭借稳定连接、多设备共享、独立设备和灵活套餐等优势,成为务实可靠的备选方案。1、流量卡黄金时代要结束了通信行业正迎来一场前所未有的“地震式”调整——曾让无数用户追捧的低价大流量卡,正在全速退出各大平台。这早已不是一次普通的竞合,而是一场趋势性的行业洗牌。回望过去,19元200G的神卡,那时真是“睡着都能笑醒”,便宜到不敢相信,爽到忍不住炫耀。那些日子,好像随便刷、随便看,流量自由触手可及。可如今,回头再看,那种
    爱上电路设计 2026-08-03 10:21 128817浏览
  • 在物联网从“万物互联”迈向“万物智联”的进程中,LTE Cat.1凭借其在速率、成本与网络覆盖之间的完美平衡,正成为中低速物联网市场的绝对主力。随着2G/3G网络的逐步退网以及新国标对终端设备智能化、定位功能的强制要求,Cat.1模组迎来了爆发式的增长窗口。在这一关键节点,基于华为海思Hi2131芯片设计的LTE Cat.1模组,凭借其在能效、射频、架构及物理规格上的底层创新,成功打破了“高性能必高功耗”的传统魔咒,为行业提供了极具竞争力的连接最优解。核心技术优势:重塑Cat.1能效与连接标杆海
    用户1778981989717 2026-08-05 21:04 150浏览
  • 摘要防爆自控系统同时布设本安信号、工业总线、动力供电三类线路,仅依靠标识标牌管控插接极易出现人为错插问题,高压动力回路窜入本安弱电回路会突破安全栅限能标准,产生点火风险。依托 A、D、K 标准化机械防呆编码体系,搭配护套颜色区分管理,适配 3 针 3 孔免焊接冷压增安型防爆航插、5PIN 总线防爆航空插头、8 芯焊接防爆法兰插座的选型使用,从物理结构层面杜绝防爆接近开关连接器、防爆传感器航插接头混用插接问题,补齐防爆系统被动安全防护体系。关键词圆形防爆连接器,防呆编码防爆航插,防爆航空插头,防爆
    kyfbest科迎法电气 2026-07-31 18:29 379浏览
  • 做蓝牙音箱的工程师大概都碰过这个局面。产品要连手机放歌,要本地播开机提示音和按键音,还要接 App 做配网和状态上报。三件事拆开,早先的常规做法是音频蓝牙一颗料、数传蓝牙一颗料、本地播放再挂一颗小 MCU 加一片 Flash。板子越画越大,BOM 越算越贵,待机电流和固件工作量也跟着涨。WT2605C 出来以后,这套需求可以集成到一颗芯片,就是 WT2605C-32N,该芯片采用QFN32 封装,4×4 毫米,把音频蓝牙、BLE 数传和 MP3 本地播放三样全包了。对蓝牙音箱来说,最实在的好处就
    唯创知音语音芯片 2026-08-06 15:14 213浏览
  • 摘要在防爆电气设计中,只参照芯数选型而忽略额定载流量,长期满负荷运行会出现插头发热、接触面氧化、IP67 密封受热老化等问题。结合常用 3 针 3 孔、4 芯、5PIN、8PIN 圆形防爆连接器,制作分级电流参数对照表,区分冷压免焊接、焊接两种接线结构的安全载流数值,设置合理电流冗余系数,搭配使用环境修正参数,规范防爆接近开关连接器、防爆法兰插座的选型计算方式。关键词圆形防爆连接器,载流参数表,防爆法兰插座,防爆端子接头,IP67 防爆防水接插件1 产品概述圆形防爆连接器触点载流能力由插针直径、
    kyfbest科迎法电气 2026-08-03 09:18 128613浏览
  • 导语在现代高速数字电路设计中,信号的完整性已不仅是理想波形推演,而是一场与物理非理想特性正面博弈的工程实践。滤波器芯片作为净化传输链路的关键屏障,其核心挑战在于:能否有效识别并滤除那些隐匿在电平跳变过程中的亚纳秒级瞬态脉冲干扰,这类干扰持续极短,却足以在高速链路中引发误触发。然而,传统函数发生器受限于采样率与边沿速率,根本无法忠实复现如此狭窄且陡峭的异常波形。针对此困境,德思特TS-AWG7000系列任意波形发生器以17 GS/s采样率与50 ps原生边沿速度,为瞬态脉冲提供精细刻画,配合SPG
    德思特测试测量 2026-08-05 14:06 5浏览
  • 智能宠物用品这几年快速普及,自动清理几乎成了智能猫砂盆的标配。猫咪用完离场,设备自动翻转清理,养宠家庭省去了每天弯腰清理的麻烦。但自动清理的第一步,是先准确判断猫到底在不在盆里。这个看似简单的问题,在小空间里并不容易做好。近场检测的痛点:距离太远反而误事猫砂盆内部空间有限。如果传感器的检测距离设得偏大,盆外路过的猫、人甚至物品都会被误判为猫在盆内,结果该清理时不清理、不该清理时乱清理,体验直接崩坏。这类产品的核心诉求其实就一句话:近距离、小范围、精准识别,不能有半点误判。常规感应方案常因检测距离
    唯创知音语音芯片 2026-07-31 16:51 297浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦