自动驾驶事故的调查报告,我前后翻过十几份。有个感受越来越强烈:绝大多数事故的根源,并不在算法本身有多笨,而是卡在传感器融合这一环上。说白了,就是车上的摄像头、毫米波雷达、激光雷达各自看到的东西,没法在极短时间内拼成一张可信的图景。

这事听起来简单,做起来极其拧巴。摄像头擅长识别颜色和纹理,能读出限速牌上的数字,但它测距全靠透视关系去猜,误差大得离谱。毫米波雷达测距准、穿透雨雾能力强,可它分不清一个易拉罐和一块石头,静态物体的点云稀疏得让人心慌。激光雷达倒是能给出高精度的三维点云,但一下雨,雨滴打在镜面上会产生大量噪点,算法得花额外精力去滤掉这些假信号。
问题就出在这:三种传感器各有各的脾气,它们输出的数据在时间戳、坐标系、置信度上全都不统一。摄像头一帧图像要30毫秒处理完,激光雷达一转就是100毫秒,雷达的刷新率又不一样。你要把这些异步的数据对齐到同一个时间切片里,本身就是个工程噩梦。更别提每个传感器还有自己的内参和外参标定误差,车开久了,震动会让摄像头偏个零点几度,融合结果就全歪了。
我见过一个典型的案例。某测试车在黄昏时分撞上了前方静止的清扫车。事后拆解数据发现,摄像头其实在碰撞前1.2秒就识别出了清扫车的轮廓,但毫米波雷达因为清扫车尾部是弧形金属面,回波信号被散射掉了,给出的距离值比实际远了将近两米。激光雷达呢,当时正好有一束反射打在路面的积水里,点云把清扫车的位置标到了车道线外侧。三个传感器各说各话,融合模块的投票机制直接懵了,最后取了个加权平均,得出一个“前方无障碍”的错误结论。
这种场景在业内叫“传感器冲突”。解决思路无非两种:要么定规则,谁在什么条件下更可信;要么上深度学习,让网络自己学权重。定规则听起来稳妥,但规则越写越多,最后变成几千行的if-else,连写代码的人自己都理不清。深度学习倒是省事,可它是个黑箱,出了事故你连怎么回滚都不知道。更麻烦的是,训练数据里长尾场景的覆盖率永远不够,你没法穷举所有传感器打架的情况。
还有个被低估的难点:融合的层级选择。前融合是在原始数据层面就合并,理论上信息损失最小,但对时空同步的要求苛刻到变态。后融合是各传感器先独立出结果,再投票决策,鲁棒性好一些,可一旦某个传感器被遮挡或欺骗,整个系统就容易被带偏。现在量产的乘用车大多走的是后融合路线,因为算力吃得少,工程上能落地。但这也意味着,只要有一个传感器“撒谎”,融合结果就可能跟着错。
说到底,传感器融合的难题不是单纯的算法问题,它牵扯到硬件标定、时间同步、功能安全架构,甚至整车电子电气设计的底层逻辑。我认识一个做融合的工程师,他说他们团队花了八个月,就为了让摄像头和激光雷达在过减速带时的外参漂移控制在0.1度以内。这种活,外人看着枯燥,但少做一点,路上就可能多一次误刹或者漏检。
短期内,我不指望传感器融合能做到完美。更现实的做法是,让融合系统学会“认怂”——当三个传感器分歧超过阈值时,直接降级到安全停车,而不是硬着头皮给一个自信但错误的结果。可惜,现在的行业氛围更愿意宣传“全场景零接管”,承认自己搞不定,反而成了稀缺品质。














































