前几天跟一位在张江做了十几年芯片投资的老朋友吃饭,聊到半夜。他说现在看项目跟五年前完全不是一个逻辑,以前问的是“你比国外同款差多少”,现在坐下来先问“你这东西跑在谁的板子上,数据最后落到谁家机房里”。这句话听着糙,但把芯片到云端这条链子上的事说透了。自主创新这四个字,早就不该是单点突破的叙事。

搞芯片的人心里都清楚,单打独斗的年代过去了。前些年国内冒出过不少做AI加速卡的团队,流片一次几千万,参数跑分看着也体面,可客户拿回去一上机架就发现问题——配套的编译器稀烂,算子库缺胳膊少腿,模型移植过去精度掉得亲妈都不认识。硬件参数再漂亮,软件栈撑不起来就是一块昂贵的硅砖。后来有几家学聪明了,芯片还没回片,软件团队先扎进客户机房里泡了半年,把主流框架的图编译和算子适配啃下来。这种苦活没人愿意宣传,但恰恰是能活下来的那批人的共同特征。
云端那边也在变。早几年谈自主创新,云厂商的思路基本是拿开源方案改吧改吧,把调度器换个名字就算自研。现在不行了,业务部门不买账。某家大厂内部做过测算,同样跑推荐模型推理,用深度定制过的自研调度框架比通用方案能省出将近三成算力。这三成在财报上就是实打实的成本项。更关键的是,当芯片和云两边的人开始坐在一起调参数,很多以前想都不敢想的优化空间就冒出来了。比如把注意力机制里某些算子直接下沉到网卡做卸载,这种玩法通用方案根本没法支持。
不过要说最难的,还是生态这关。芯片指令集再精简,没人给你写编译器就是废纸;云平台功能再全,ISV不往上迁就是空转。国内有家做RISC-V服务器的公司,前两年为了说服一家数据库厂商做移植,派了五个工程师驻场三个月,帮人家把底层原子操作和内存屏障的坑全趟了一遍。后来这家数据库成了他们的标杆案例,陆陆续续又带进来七八个中间件伙伴。这种笨功夫看着慢,但比开十场发布会管用。
还有个容易被忽略的角落是存算一体。传统冯诺依曼架构下,数据在存储和计算单元之间搬来搬去,功耗大头全花在搬运上了。国内有几支团队在做的近存计算方案,把一部分计算逻辑塞进存储阵列旁边,跑某些特定负载时能效比提升非常明显。这东西离大规模商用还有距离,良率和编程模型都是坎,但方向值得盯。毕竟当制程红利逼近物理极限,架构创新就是为数不多还能撬动性能杠杆的地方。
人才流动也在悄悄改变行业面貌。前几年芯片公司挖人主要盯着外企在中国的研发中心,现在更多是从互联网大厂的系统架构部往回吸人。这批人懂业务负载、懂分布式调度,进来之后最大的贡献不是写RTL,而是把“芯片该怎么配合上层业务”这件事讲明白了。反过来,云厂商也开始从芯片公司招人去做DPU和智能网卡,两边的人才水位逐渐拉平。
说到底,从芯片到云端的自主创新,拼的不是某一项指标登顶,而是整条链路能不能形成闭环反馈。芯片定义阶段就有云业务的人参与,云平台迭代时知道底层硬件的脾气,中间的工具链和框架有人愿意下苦功夫打磨。这些事单拎出来都不性感,但合在一起就是护城河。那些跑通了的团队,现在已经开始往外输出标准了——不是靠嗓门大,是靠手里有真正跑过大规模业务的底牌。这条路还长,但方向已经比前几年清晰多了。












































