br />
没有残差连接,就没有后来的GPT,没有BERT,没有任何你能叫得出名字的大语言模型。



而现在是2014年4月。



任少卿提前了将近一年半。



顾屿闭上眼睛。



前世的记忆潮水般漫上来,不受控制。



2020年。他拿到天使轮的那个夏天,北京五道口的一间地下室办公室,八个人,六台电脑,空调坏了三天没人修。



他站在白板前画TranSfOrmer的架构图,给团队讲什么是自注意力机制,什么是多头注意力,什么是位置编码。那时候他以为自己看到了未来。



2022年。A轮融资到账,团队扩到四十多人,搬进了望京的写字楼。



他们基于TranSfOrmer训练中文大语言模型,做垂直行业应用,对标ChatGPT。烧了两个多亿,模型效果勉强能打。投资人说,再坚持一轮,B轮估值翻三倍,上市不是梦。



他信了。



然后2024年底,DeepSeek的技术报告发了出来。



不到六百万美金的训练成本。



用了一种叫MOE的混合专家架构,让模型学会了“只激活需要的那部分参数”,不用的部分直接休眠。



配合极致的底层算力优化和开源策略,效果直接对标上亿美金训练出来的顶级模型。



一夜之间,他那套靠堆参数、堆数据、堆算力硬撑出来的商业故事,全部归零。



投资人撤资的邮件是凌晨两点发来的,措辞很客气,意思很残忍:赛道逻辑变了,我们需要重新评估。



客户解约的电话是第二天早上九点打来的,对方甚至没听他解释完,只说了一句“DeepSeek免费开源的效果比你们收费的还好,我们没有理由继续付费”。



团队散伙那天,核心算法工程师把工牌放在会议桌上,什么都没说,转身走了。



门没关严,走廊里传来的声音很轻,但顾屿听得清清楚楚。



2025年春天,公司清算完毕。



他在锦城的出租屋里,盯着天花板上那道裂缝,想了很久很久。



然后他重生了。



所以他对AI这条路的理解,从来不是什么“前瞻性预判”。



他是亲手走过那条路上的每一步,踩过每一个坑,最后被终局的浪头拍死的人。



他知道训练大模型时候学习率该怎么调。



知道RLHF的人类反馈强化学习有多少坑。



知道MOE的路由策略为什么能把成本打下来。



这些知识是他的武器,也是他的伤疤。



前世他死在三件事上:起步太晚,资本不够,算力受制于人。



这一世,全都翻过来了。



雅安基地的算力,够。



百亿级的资金储备,够。



任少卿加九章团队的人才密度,够。



本章未完,点击下一页继续阅读

(3/4)

章节目录

高二分科,我选校花也选亿万身家所有内容均来自互联网,零点小说网只为原作者黑狗不爱吃汤圆的小说进行宣传。欢迎各位书友支持黑狗不爱吃汤圆并收藏高二分科,我选校花也选亿万身家最新章节