「AI推理提速生意拆解:芝加哥大学本科生做GPU优化Agent云,拒绝云巨头收购、4个月做到800万美元ARR——Wafer的4000万美元A轮(开源模型2-3倍提速+自建推理云)」

「AI推理提速生意拆解:芝加哥大学本科生做GPU优化Agent云,拒绝云巨头收购、4个月做到800万美元ARR——Wafer的4000万美元A轮(开源模型2-3倍提速+自建推理云)」
「AI推理提速生意拆解:芝加哥大学本科生做GPU优化Agent云,拒绝云巨头收购、4个月做到800万美元ARR——Wafer的4000万美元A轮(开源模型2-3倍提速+自建推理云)」

👤 人物画像

这个故事的主角是两个人:Emilio Andere和Steven Arellano。两人在芝加哥大学读大一的时候认识,后来成了室友——注意这个细节,很多改变行业格局的公司,起点不是商业计划书,是宿舍室友。他们的公司叫Wafer,2025年成立,到2026年9月拿到A轮融资时,公司年龄大约一岁。放在硅谷这个”本科生创业”已经被反复证明的土壤里,他们依然属于最年轻的那一档:创立公司时,两人都还是本科生。

先看履历,这两个人的”本科生”标签其实有很强的欺骗性。Steven Arellano在Google做过Bard(Google的对话AI产品)的基础设施工作,还在顶级量化对冲基金Two Sigma做过性能工程——也就是说,他早就干过”让大规模系统跑得更快”这件事,而且是拿着业内最高标准练的手。Emilio Andere则在美国能源部下属的阿贡国家实验室训练过天气模型,在芝加哥大学的SAND实验室做过机器学习安全研究,还在NeurIPS这种顶会上发表过论文,也曾在AI研究创业公司Elicit工作过。再看他们的社交账号ID——一个叫@gpuemi,一个叫@gpusteve——两个人的公开身份标签都是GPU,这是教科书级别的个人定位:还没创业,人设已经锚定在赛道上

他们做的事情,用一句话概括:用AI Agent去优化AI推理。GPU内核(kernel)是决定AI负载能不能高效利用加速器硬件的底层程序,写好它需要极稀缺的性能工程师,一调就是几周。Wafer的做法是造一个自主Agent,让它去写内核、改批量调度、调内存布局,把原本”人类专家手工一次性优化”的活,变成”AI持续自动优化”的活。公司官网的口号直译过来就是:”能优化AI的AI”。

2025年夏天他们进了Y Combinator的S25批次。最初的切入点更窄——只是一个写GPU内核的Agent工具;随后他们做了一个关键决定:沿服务栈向上走,自己做推理云。这个转型是整个商业故事里最重要的一个动作:内核工具解决的是一个窄的工程问题,收入天花板肉眼可见;而把优化过的开源模型作为云服务卖出去,拿到的是持续性的基础设施订阅收入,并且直接站在每一次客户工作负载的成本与性能决策现场。

2026年9月1日,Wafer宣布完成4000万美元A轮,由Marathon和Chemistry联合领投,Wing、AMD Ventures、Outset Capital参投,老股东Fifty Years和Y Combinator继续加注。天使名单豪华到晃眼:Google传奇工程师、Discovery Loop CEO Jeff Dean,Vercel CEO Guillermo Rauch,DoorDash联合创始人Andy Fang,Cloudflare CEO Matthew Prince,Notion COO Akshay Kothari,Deepgram CEO Scott Stephenson,The Bot Company CEO Kyle Vogt,还有OpenAI的Wojciech Zaremba。据The Information报道,本轮融资估值超过2亿美元,而据媒体报道,这已经是五个月前400万美元种子轮估值的约50倍。更值得注意的是:他们此前拒绝了多家更大的推理和云厂商的收购报价——两家成立一年的本科生公司,把云巨头递过来的支票推了回去。

💰 收入时间轴

时间 关键节点 收入/规模信号
2025年 Andere与Arellano(芝加哥大学同学、室友)创立Wafer,切入点为写GPU内核的Agent 产品原型阶段,无收入
2025年夏 进入Y Combinator S25批次 获得YC背书与第一批机构人脉
2026年4月 完成400万美元种子轮,Fifty Years领投,Liquid 2与YC参投,Jeff Dean与OpenAI的Zaremba天使跟投 资金验证:Agent工具方向成立
2026年上半年 战略扩张:从内核工具上移至推理云,上线云平台 商业模式从”卖工具”转向”卖服务化的优化算力”
云平台上线后约12周 据CEO Andere对The Information的表述,年化收入达到约800万美元(约合每月66.6万美元的年化节奏) ARR从0到800万美元,用时约4个月
上线4个月内 客户名单出现Vercel、Inworld AI等知名公司;据Andere表述毛利率约50% 收入质量:头部客户+可运营的正毛利
2026年7月 公布关键基准:GLM-5.2跑在AMD MI355X上,达到Nvidia B200约80%的吞吐,成本不到一半;对开源模型普遍宣称2-2.8倍于基线的提速 性能资产变成获客与融资的弹药
2026年9月1日 宣布4000万美元A轮,Marathon与Chemistry联合领投,AMD Ventures等参投;估值超2亿美元(据The Information报道,CEO未确认) 此前拒绝多家云厂商收购报价;累计披露融资4400万美元

几个数字放在一起看,信息量最大的不是估值翻50倍,而是4个月0→800万美元ARR这条斜率。要诚实标注两点:第一,ARR是年化运行率的推算——从上线仅12周左右的收入外推整年,属于投资人行业里公认的”乐观口径”,但即便打对折,这个增长速度也足以让Wafer成为推理赛道最快的新人之一;第二,据Andere表述毛利率约50%,这个数字在软件行业偏低(SaaS通常70-80%以上),原因是租加速器算力本身很贵——它说明这门生意是”重资产+强技术杠杆”的混合体,不是轻飘飘的纯软件故事。

还有一条隐藏时间线值得单独说:他们拒绝了收购。对一家成立一年、账上只有几百万美元种子资金的公司来说,拒绝云巨头的收购报价是一个用全部筹码下注的决定——赌的是推理优化这条赛道的终局价值远高于当下的收购价。四个月后,A轮估值证明了这场豪赌的市场定价。

🔗 相关案例推荐

© 版权声明
THE END
喜欢就支持一下吧
点赞464 分享
arvinzr的头像-格赚 | AI赚钱案例库 - 一人公司赚钱模式与AI副业项目实操
相关推荐
评论 抢沙发

请登录后发表评论

    暂无评论内容