MoreRSS

site iconKaiQu | 曲凯 | 42 章经修改

公众号:42章经。由xlab生成。
请复制 RSS 到你的阅读器,或快速订阅到 :

Inoreader Feedly Follow Feedbin Local Reader

KaiQu | 曲凯 | 42 章经的 RSS 预览

活动报名:如何训出自己的模型?|42章经

2026-09-06 21:00:00

原创 曲凯 2026-09-06 21:00 北京

模应一体的新趋势

最近硅谷有了新热点:主权 AI 和 Personal Intelligence。简单来说,就是很多人开始相信,未来会有越来越多的应用公司和个人,训练自己的模型。

对绝大多数人来说,训练模型仍然是一件听起来遥不可及、门槛很高的事,但我们最近一期播客的嘉宾逯雨鑫却认为,它非常简单,简单到他此前没有 AI Lab 的经历,也不是 AI PhD,只用了 2 周和数百美元,就后训练出了两个登顶 Hugging Face Model Trending 榜首的小模型。

在播客里,他完整分享了自己的 pipeline,以及对模型厂和应用公司之间关系等话题的思考。雨鑫已经很坦诚地分享了许多实操经验和踩过的坑,但相信很多朋友仍会有更具体的问题,或想了解更多。因此,我们也组织了这次线上活动,邀请雨鑫来和大家认识、交流一下。

具体报名信息请见上方海报。活动时间为北京时间 9 月 12 日(周六)上午 10:30,线上进行,免费参加。我们会优先通过回答更认真、且与我们背景更匹配的朋友(非投资行业),尤其欢迎应用创始人。具体通过情况请以工作人员通知为准。

期待和大家认识 & 交流!

跳转微信打开

一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型|42章经

2026-09-06 21:00:00

原创 曲凯 2026-09-06 21:00 北京

模型的价值会慢慢地往应用公司让渡?

本期节目的嘉宾逯雨鑫是 Mind Lab 的研究员。此前,他以个人开发者的身份,仅花费数百美元,后训练出了两个登顶 Hugging Face Model Trending 榜的模型。

本期播客原文约 15000 字,本文经过删减整理后约 4800 字。

曲凯:今天大多数人还是觉得训模型是一件非常难的事情,不知道有哪些步骤、具体该怎么做。大家印象中,训模型的人一般也都是各种 PhD、researcher 之类的。但雨鑫你其实不是 AI PhD,此前也没有 AI Lab 的训练经验,为什么能训出两个登顶 Hugging Face 开源模型榜首的小模型?

雨鑫:其实要训出能在工业界用起来的模型,路径是很明确的,没有大家想象中那么难。只要自学一些基础,再加上现在各种 AI 工具的加成,很多人都可以做到。

曲凯:你训练这两版模型,大概花了多少时间和钱?

雨鑫:第一版花了 5 天左右,第二版时间长一些,大概两三周,然后总共花了几百美元。硬件上,我就用了一张 5090。现在租一张 5090,每小时可能只要一两美元,真正训练一次也就是十几个小时。即便迭代几版,硬件成本也不会超过 100 美元。软件上,我用了一个 200 美元的 Claude Max Plan,主要用来合成目标领域的数据。

曲凯:最后训练出来的效果怎么样?

雨鑫:我的模型主要针对 agentic 场景,把对应的 benchmark 从底座模型的 15 分提升到了 55 - 60 分左右。

不过,个人或应用公司训练模型,往往需要做一些取舍。在资源有限的情况下,你可以让模型在目标能力上变强,但其他 benchmark 或多或少会下降。

曲凯:我能不能简单理解成,你的做法就是用更强的 teacher model 生成数据,通过 SFT 蒸馏出一个特定领域的小模型,让它在某些任务上比原来的底座更强?

雨鑫:是的。

曲凯:这听起来并不复杂,但为什么这件事还没有大众化?是我们有盲区、其实很多人已经在做,还是确实做的人不多?

雨鑫:确实没有那么多人做,最主要的原因是大家认为它非常复杂。但其实这件事的流程没有那么难,总共可以分成五步。

第一步:明确自己要做什么。

很多个人开发者上来会先追热点,或者盲目刷 benchmark。但更应该从自己的真实需求出发,想明白要提升模型哪方面的能力。我的项目能火起来,就是因为抓住了有真实需求的场景,选定了 coding 和 agentic 这两个方向,所以模型发布后有很多下载和使用。

第二步:选底座模型。

这里要考虑模型架构、语言能力和具体场景。比如我用的是 Gemma 4 12B,当时就遇到了一些问题,比如它的中文能力比较差、有时会说粤语,而且架构没那么主流,训练过程会很麻烦。

我个人体感上,Qwen 是坑相对比较少的开源模型。

第三步:设计数据管线。

我用到的数据大概有三类:一种是合成数据,就是让一个模型扮演用户,另一个模型回答;一种是开源数据,在 Hugging Face、ModelScope 这样的平台上其实有很多;还有一种是自己或其他真实用户的使用轨迹。我自己用到的真实数据,很多是关注我这个模型的用户主动贡献的。

然后我有一个比较大的经验是,合成数据可能没有那么好,它更像靶向药,适合定向解决某个问题。实际训练时,我 60% - 70% 还是用的真实轨迹数据,遇到具体问题时才用合成数据。

举个例子。我训练时会遇到模型过度自信的问题,就是跑 benchmark 时,模型明明没有真的完成任务,却说自己完成了。要解决这个问题,很难从公开或者日常使用数据中找到合适的选择,就得有针对性地去合成。

第四步:决定训练方法。

现在工业界比较流行的有两种做法,一种是 SFT,简单来说就是把 teacher model 的能力蒸馏到小模型里,实际效果取决于数据质量;另一种是 RL,被吹得很神,但我个人觉得效果不如前者。

当然还有很多别的方法,比如 OPD(On-Policy Distillation)。但我感觉 RL 和 OPD 的成本都比较高,更适合锦上添花。对很多应用公司和个人来说,SFT 配上好的数据,就已经能完成很多工业场景里的目标了。我自己也是只选择了 SFT 去训练。

第五步:用特定的 benchmark 测试效果并迭代。一版训练出来的效果不好,就从错题和失败轨迹里找原因,调整数据,再训练下一版。

这整套流程并不复杂。过程中需要的训练脚本、数据、benchmark 和环境等,基本都有开源或第三方服务的解决方案。你可以去找合适的方案,把代码拉下来,再借助 agent 改成适合自己模型的版本。实际训练也很快,几个小时就能跑一版。

其中最大的、甚至唯一的难点和卡点就是数据。我自己 95% 的时间都花在这一环。

曲凯:具体难在哪?

雨鑫:难在你得看懂数据出了什么问题,以及该用什么数据去改变它。

拿合成数据来说,现在的模型还不能稳定地合成高质量数据,需要大量人工审核。我做 V2 时花了更多时间,主要就是因为要审数据。假设合成了 5000 条数据,我可能要自己抽查 500 条,然后告诉模型有什么问题,让它重新生成,再继续检查。

曲凯:那你总共用了多少条数据?

雨鑫:我总共整理了接近一万条数据,清洗、筛选之后,用于训练的有几千条。对特定领域的小模型来说,这个量就已经可以产生明显效果了。

曲凯:我们之前和人交流时,经常听人讲,你没办法预先评估数据的效果,都得拿去训练,再回头改。你的经验是怎样的?

雨鑫:这件事确实没什么捷径,只能不断测试和迭代。而且一版没有达到预期非常正常,继续做就好了。

如果你看数据就知道它有问题,那这版训练大概率也不对。

而且即使你和 AI 都检查过,自己抽样也觉得很好,训练出来仍然可能有问题。这背后的一个重要原因是 capacity gap,也就是 teacher model 太强、学生太弱。比如你要把一个 3T 的模型蒸进一个 12B 小模型,很多能力小模型根本学不来。

曲凯:那怎么评估蒸馏的好坏?从工业级角度看,是不是怎么有效、怎么成本低就怎么来?那最基础、最简单的所谓「硬蒸」,是不是反而最好?

雨鑫:评估数据和蒸馏的标准是一样的,就是看你的操作和目标是不是对齐的。

举个例子,假设你想提升模型的安全边界,却只围绕 benchmark 做数据,那即使分数涨了,也不算好的蒸馏。相反,只要你知道自己想做什么,最后也真的把模型的分布往那个方向拉了,即使其他 benchmark 掉分,也是好的蒸馏。

曲凯:明白。那一家公司自己训练一个小模型,大概要多少钱?

雨鑫:几千到一万元人民币以内,就能训练出一个比较符合需求的小模型。如果要训练大一点的模型,卡量就得跟上,可能需要十几万到二十万元。

不过这里说的只是训练成本。真正部署给用户调用是 serving 端的事,里面还有很多坑,需要考虑 infra 架构、并发量和硬件等问题。如果只是几路或十几路并发,我估计一个小模型加一台 H200 就够了。

曲凯:那你觉得未来训练模型会不会变成中大型公司的标配,就像互联网时代都要做前后端一样?

雨鑫:我觉得会。中大型公司配一个三四人的小团队就行,成本主要就是这几个人的工资以及显卡。

小公司如果暂时没预算,可以先找 AI Lab 或第三方服务商合作。等自己的应用真正起来,有了几百万、几千万用户,再组建内部 AI 团队。

不过,我觉得自己训练模型的成本还会继续下降。现在显卡和内存价格还在高点,部分原因是供应没有跟上 AI 的需求。但随着供应跟上,显卡可能像早期的手机流量一样,一开始很贵,后来越来越便宜,最终甚至成为不限量的基础设施。

曲凯:既然每个环节都有第三方或开源方案,为什么还没有人把它们整合成一套完整的 pipeline,让普通人不用学习每个环节,也能训练出自己的小模型?

雨鑫:训模型可能确实会逐渐商品化,你说的也是很多公司都想做的事。其实海外也已经有 Unsloth 这样的公司。包括 Hugging Face 上的 Jobs 平台,也在做这件事。

目前这种服务的价格还不算便宜,infra 和 serving 也有不少问题。而且即便有这样的方案,数据仍然是最重要的一环。训练脚本可以标准化,但理解业务、发现模型的问题、知道该造什么数据,还是需要人来做。

曲凯:那未来 AI 应用公司和模型公司之间的关系会怎么变化?

雨鑫:我觉得 AI Lab 的数量会减少,但少数头部 AI Lab 仍会成为赢家,并掌握很高的价值。一方面,pre-training 依然得有 AI Lab 来做,因为这件事非常吃资源,应用公司未必能搞定。另一方面,很多早期应用公司得先把产品跑起来,再组建团队训练模型。那在此之前,这些公司还是要找 AI Lab 提供服务。

曲凯:你描述的好像还是当下的状态?但如果按照我们刚刚的推理,未来会有很成熟的训练模型的解决方案,应用公司训练模型的门槛可能会比你刚刚讲的低很多?

以及我自己的感觉是,现在 AI Lab 在明确追求更高 level 的事情,比如解决诺贝尔级别的科学问题、AI4S 或具身等问题,或者解锁一些我们现在没想到的场景。而对于很多日常场景来说,也许大家基于开源模型做一个内部模型,就够用了。

所以最近美国红杉也在讲,AI 应用公司未来反而会变成 Neo Lab。

雨鑫:是。至少后训练很可能逐渐被应用公司接管,因为应用公司离用户更近,拥有最真实的数据,也不愿意把自己的核心数据交给别人。那么行业里领先的应用公司,确实可能会长成 Neo Lab 的样子。而且其中的中大型公司,甚至也可能向更小的公司提供 API 或 token plan。

曲凯:这很像推荐算法时代发生过的事情。字节这样的公司是先有应用、场景、商业闭环和用户数据,才有了更好的推荐算法。你很难找到一家第三方公司,说我只做推荐算法。

这也解释了为什么 AI Lab 愿意花很多钱买数据。现在很多人可能还没有意识到数据的价值,就像移动互联网早期,大家不理解为什么公司要花很高的成本买用户,后来才发现越早获取,成本反而越低。

雨鑫:对。AI Lab 买数据,其实就是想知道用户会提出什么问题、AI 在真实场景里怎样完成任务。所以有些公司让用户免费体验新模型,一方面是为了宣传,另一方面也是为了收集真实使用数据,用来迭代下一代模型。

曲凯:是。然后过去一段时间一直有个论调,觉得模型好像会吃掉一切,应用公司的价值很低。前几周,我们录了一期复盘 AI 应用的节目(回顾:https://mp.weixin.qq.com/s/sgZ8z57wmD01N48Qjhcp6g),当时我也比较悲观。

但最近聊下来,我反而觉得 AI Lab 和应用公司的价值都在上升。未来某个时间点,模型的价值可能会逐渐向应用公司让渡。

最后我们再聊聊 Local AI 吧。你觉得这会是一个 PC 级别的机会吗?因为计算机刚出现时,一台机器可能要占满整个房间,后来变成每个人都有一台 PC。AI 会不会也从全球只有几家大模型公司,走向每个人都有一个运行在电脑、手机或其他端侧设备上的模型?

雨鑫:我觉得一定会,而且已经在往这个方向发展。

一个非常重要的驱动力就是数据安全。你在调用上游 API 时,数据一定要流经服务提供方。所以对数据敏感的个人和公司会越来越倾向于 Local AI。这里也提醒大家,一些来路不明的中转站价格看起来很便宜,但存在很大的数据泄露风险。

这可能也是为什么千问一直在发布小模型。随着芯片和统一内存继续升级,本地能运行的模型会越来越大,能力也会越来越强,未来很多人都会有自己的本地模型。

陈皮:抱歉我插个问题。我是陈皮,在42章经做内容。我想问,用户最终会不会还是会追求 SOTA?假设 OpenAI、Anthropic 一直在发布最前沿的模型,即使本地模型已经足够完成日常工作,人们真的愿意使用一个离 SOTA 还有差距的模型吗?

雨鑫:这确实是 Local AI 现在最现实的问题。我自己的 Local AI 使用率也不算高,因为它确实还会犯错,能力没有最前沿的模型强。

但 Local AI 的优势有三点:

一是前面提到的,很多人对数据隐私的需求确实很强烈;

二是在一些领域,比如网络安全、生物领域,SOTA 模型会有拒答的问题,所以即使本地模型不是 SOTA,一些用户还是愿意使用,或者说不得不使用;

三是本地模型更便宜。举个例子,我很喜欢武侠小说,会想用 AI 续写或者改编,但这种任务的 token 消耗特别大。如果全部调用 API,成本可能非常高,而用 Local AI 就不太需要额外支付 API 成本,很划算。

曲凯:我补充一个思考角度,就是对用户来说,到底什么算是 SOTA?今天模型能力已经足够解决很多问题了,那继续追求更好的模型,从性价比上未必一直 make sense。就像很多人觉得 4G 已经够用,不一定非要 5G、6G。

雨鑫:不过很多人确实会盲目追求最强的智能,不管自己是否真的需要。

曲凯:但我觉得,最后可能还是豆包这样的产品用户更多。真正关心模型极致能力的人还是少数,大多数用户更关注产品用起来方不方便、性价比是不是足够高。而且 Local AI 未来也未必需要人主动选择,而是会直接被应用公司和硬件公司做进产品里。

最后,在训练模型这块,雨鑫还有什么想补充的吗?

雨鑫:有三个建议。

一是,如果个人或应用公司对训练模型感兴趣,最好的开始时机可能就是现在。因为如果有一天,模型厂商不再开源好的小模型,将会对应用公司造成很大的打击。所以对有预算的中大型应用公司来说,现在就开始基于优秀开源模型做后训练、持续迭代,是更稳妥的选择。

二是,虽然可以借助 AI,但不要过度相信 AI。遇到问题要及时查真实资料,或者看开源社区里已经成功的案例。

最后,别太快放弃。自己训模型的流程里,每个环节都会遇到坑,这非常正常,一版一版迭代就好。

【活动预告🥳】

9 月 12 日,我们会请到雨鑫做一场线上活动,感兴趣的朋友欢迎点击链接或扫描下面的二维码,一起来认识&交流!

42章经

思考事物本质

跳转微信打开

活动报名:RSI 和合成数据|42章经

2026-08-16 21:00:00

曲凯 2026-08-16 21:00 北京

和 model researchers 一起交流

最近几个月,AI 应用侧比较冷,但模型侧非常热闹,国内外模型厂都在持续发版、交替领先。过去一段时间,我们也密集找了很多 Model Researchers 交流,想看看底层正在发生哪些变化。

聊下来,一个很明显的感受是:

数据变得越来越重要。

过去几个月里,也有一些专门做数据的公司跑出来,收入都做得非常高。Evolvent AI 就是其中之一。

在新一期播客里,我们请到了 Evolvent AI 的联创繁青。繁青是 01 年的 PhD,之前在 Kimi 做过一年多 RL infra 和 agent 相关工作,参与过 Kimi K2.5、Kimi Linear 等重要模型发版。

在播客里,我们聊到了模型竞争、算法 / 数据 / infra 之间的关系、RSI,以及比较敏感的蒸馏话题。繁青讲得非常实在,我们把节目内容发到 X 上后,也在 researchers 中间获得了一些关注(之后还会在 X 上继续发一些 memo,欢迎关注~)。

但播客毕竟是单向输出,而且是公开内容。其实围绕基模、RSI、数据,以及国内模型厂的真实差异,还有很多问题值得继续探讨。

所以我们组织了这次线上活动,请繁青和大家一起认识、交流一下。现场也会有数十位 Model Researchers 参加。

具体报名信息请见上方海报。活动时间为北京时间 8 月 22 日(周六)上午 10:30,线上进行,免费参加。我们会优先通过回答更认真、跟我们背景更匹配的朋友(非投资行业),具体通过情况请以工作人员通知为准。

期待和大家认识 & 交流!

跳转微信打开

从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|42章经

2026-08-16 21:00:00

原创 曲凯 2026-08-16 21:00 北京

蒸馏并不是国模变强的决定性因素

本期嘉宾繁青是 Evolvent AI 联创。他是 01 年的 PhD,曾在 Kimi 做了一年多 RL infra 和 agent,参与 Kimi K2.5、Kimi Linear 等重要模型的发布。Evolvent AI 也是这批数据公司里跑得比较好的几家之一。

本期播客原文约 19000 字,本文经过删减整理后约 6200 字。

编辑整理:陈皮

曲凯:我们最近聊了很多模型、算法相关的人,发现出来创业的人里,大多是 post-training 背景,而 pre-training 背景的很少。这是为什么?

繁青:做 pre-training 很吃资源,初创公司很难 cover 这块成本。而 post-training 就好很多,路径也比较明确:要么做合成数据,要么做平台类的东西。后者可能有点抽象,可以简单理解成做 bench。

不过现在的 bench 和以前不太一样。

以前主要考模型的推理和做题能力,现在还要考模型在真实环境里的操作能力,比如能不能很好地操作飞书、Notion 等软件。这种 bench 如果做得足够好,很容易转成落地的商业模式。

曲凯:但以前做题和 coding 的那种 bench,可验证性更强,最后对一下结果就行。如果是要造一个环境,该怎么评判结果的好坏?

繁青:会比以前复杂。

首先要确保模拟环境和真实环境是对齐的。举个例子,我们在环境里造了一个 Notion,真实世界里也有一个 Notion,那在输入相同时,两边的输出是不是一样?如果一样,至少能证明这个环境是对的。

另外就是要检查结果。就像你说的,以前可能对个结果就行,但现在得拆出很多维度的小得分点。这些得分点目前还是比较依赖人的精细设计。

曲凯:明白。我最近听到一种说法,说 post-training 的人其实每天主要是在做数据?

繁青:确实,尤其在大厂。举个例子,大厂之外的人要 SFT 一个模型,可能得去 GitHub 拉仓库、找 GPU、配环境、整理数据,再训练。

但在模型厂内部,这一套已经被做成了服务。研究员很多时候只要提交请求,然后等结果就行。在这种情况下,研究员最重要的事就是把数据做好。

曲凯:那 post-training 是不是相对比较枯燥?现在训模型的门槛是不是也没有大家想得那么高了?

繁青:后者我比较认可。对大部分研究员来说,训练模型的门槛确实降低了。但如果你是做 infra,相当于是在做那套服务,里面还是有挺多坑的。

至于 post-training 是不是枯燥,我觉得倒不一定,因为造数据本身很难,即便现在有 agent 参与,不同的人造出来的数据也不一样。

我们最近做了一个 RSI bench,就在讨论 agent 能不能直接完成造数据、迭代训练模型这件事。目前看,agent 只能做一些比较机械的事。比如某批数据导致模型回答格式错了,agent 可以发现并修改。但如果要让它提出造数据的 insight,现在还做不到。而模型厂的研究员在这件事上有很多自己的 know-how,这也是大家的核心能力。

曲凯:不同人做出来的数据好坏,大概体现在哪里?

繁青:最直接的量化标准,是这批数据能不能在模型不作弊的情况下,让模型在目标 benchmark 上提分。

还有一些其他考虑。比如我用代码数据训练模型,它在代码 bench 上提升了,会不会让写作这类偏文科的能力下降?也要看难度是不是适中。太简单的数据没用,太难的数据,模型也学不好。

不过,要正经检验数据质量,还是得拿去训练。训练前,只能做一些初筛。

曲凯:明白。你刚从 Kimi 出来不久,现在 Kimi、MiniMax、智谱这些国内模型厂都在陆续发新模型。你怎么看国内模型现在的发展阶段?大家在拼什么?

繁青:从已经发布的模型来看,国内模型和国外模型的差距在缩小。

当然,具体相差多长时间很难估计,因为国外厂可能有自己的存货没发出来。但比如 Kimi K3,在国内卡可能只有国外十分之一的情况下,效果已经接近 Fable 5 了。

我认为这个结果,主要来自预训练。

国内有限的资源,反而倒逼出了国模在 pre-training 上的架构创新。比如 Kimi Linear、DeepSeek 的 Multi-head Latent Attention,相比于原有的 attention 机制,都是希望用更少的训练资源达到更好的效果。

但在后训练上,国内可能比国外要弱一些。这里的弱不是说技术实力弱,而是像 Anthropic、OpenAI 这些厂,在数据上的积淀更早。国内积淀相对少,所以目前可能会通过蒸馏来补足短板。

曲凯:这和我预想的不太一样。我之前以为,pre-training 部分海外的人才密度更高,卡也远多于国内;而 post-training 更偏工程,理论上应该是国内更有优势的部分。但你认为国内在 pre-training 上更有特色,post-training 反而弱一些?

繁青:对,我和身边一些朋友都比较 buy in 这一点。

预训练更拼研究员的聪明才智。从实际结果看,现在全球范围内比较好的模型架构也就是 Kimi 和 DeepSeek 做出来的,而且它们至少已经在自己的公司里证明了 scale 能力。

而后训练就像你说的,更工程一些。工程上的时间差更难弥补,而且数据积淀比较拼人力和组织。

曲凯:这还蛮有意思的。

那之前智谱在 coding 上长期领先,现在 Kimi K3 出来之后,榜单和反馈都很好。所以后面模型厂还会交替领先吗?尤其像你说的,Kimi 在模型架构上有创新,而且这版也是一个大参数模型。那其他家还有可能很快超过吗?

繁青:只看 bench 上的结果,基本还是会交替领先。但大家相互追赶的过程中肯定有时间 gap,而且真实体感不一定完全一样。

曲凯:所以今天各个模型在拼的,到底是架构创新、数据、infra,还是什么?

我们最近也聊了很多人,我的一个感受是,人才只要肯花钱就可以招,数据只要肯花钱也可以做。那中长期是不是还是拼卡,最后是不是还是大厂更有优势?

繁青:从技术上说,架构、数据、infra 都要拼。

架构决定你能不能在有限资源里榨出更多东西;数据决定你能不能在 benchmark 上达到更好效果;infra 保证内部迭代速度。

不过技术一直在流通,大家的技术水平差异不会特别大。

那长期看,卡当然非常重要。但即便大厂有更多卡,我个人还是更看好初创公司。

因为我觉得最后可能要看组织形态,也就是怎么让公司作为整体跑得更快,比如部门怎么划分更合理、多模态部门到底要不要单独划出来。混元就是一个例子。它在没有改架构的时候可能做得比较差,但现在突飞猛进。

曲凯:说到多模态,有人说,多模态、世界模型不在智力主线上,真正提升模型智力的还是 coding、数学这些。你怎么看?

繁青:这个说法有点绝对。我觉得多模态也应该放到主线上。只是现阶段基于资源考虑,还不太能做全模态优化。而且多模态不像文本信息那样高度压缩,噪声更多,发展起来也会慢很多。

但我相信之后多模态会变得重要,因为 AI 要进入物理世界,还需要视觉、听觉、触觉等各种东西。

曲凯:明白。那现在有没有共识,下一个阶段最核心的是什么?

繁青:现在的共识可能就是 auto research,或者叫 RSI、self-evolving、AI for AI。

目前大众可能更倾向于把 RSI 理解成模型自己迭代自己,得到一个更强的模型;而 auto research 则更像是已经有一个强模型,让它持续迭代做某件事,比如写出一个好的 GPU kernel。

但我认为这些概念说白了都是一件事:

给模型一个工作环境和目标,看它能不能持续操作,拿到结果反馈之后修改之前的操作,最后突破上限。

曲凯:我理解这件事其实有几层可以做。

从最表层的产品结果来讲,可以让模型输出结果后,先不给用户,而是多尝试几次,得到更好的结果之后再给出来。这层应该比较简单,之前也有人在做。

最上层,就是模型能不能自己训练自己。

中间是 harness 部分,也就是怎么让 harness 自己转起来。这层我想多理解一下,因为有人说模型未来会把 harness 一起训进去,就没有所谓 harness 这层了。你怎么看?

繁青:我倒不认为 harness 会不存在。

现在模型厂基本都有自己的 harness,一般会跟着模型一起发版,因为后训练时,模型的输出会经过 harness,反向传播也会让模型越来越适配这个 harness,所以这两者往往会配套出现。当然,我相信 harness 会越来越简单。

曲凯:那未来几年还会有第三方 harness 的空间吗?

繁青:要分情况。

像 coding 这种通用领域,可能确实没有第三方 harness 存在的必要。

但在垂直场景里,一方面大家可能没必要用最强的模型,另一方面也没必要用它们配套的 harness。用一个相对弱的开源模型,配一个简单的 workflow,可能就可以完成需求,而且成本更低、速度更快。这时可能就有第三方 harness 的空间。

曲凯:但如果真能实现 RSI,为什么不用模型自己训一个垂直领域的 harness?以及如果是这样,是不是模型仍然会吃掉一切,还是垂直领域还会有什么价值和壁垒?

繁青:用一个强大的模型写 harness 没毛病,但是这个 harness 未必要接最强的模型。

现在普通用户已经很难感受到新模型能力强弱的差别了,对一些垂直领域来说更是如此。所以大家大可以用强大的模型去指导一个比较小的开源模型,然后在自己的垂直场景上进行迭代,后面就只用这个小的垂域模型。

曲凯:那最终模型商的价值会怎么变化?就像你讲的,现在一些基础模型就已经够用了,最近 GPT 也降价了 80%。那有没有可能直到有一天,大家发现足够使用的模型已经接近免费了?

繁青:我会分两方面来看这个问题。一方面,如果未来真的出现一两家独大的局面,模型价格未必会一直降。因为现在模型降价不一定是因为卡很多、成本低,也可能有商业模式和竞争方面的考虑。毕竟现在开源社区很强,又有竞争对手。

另一方面,垂域还有很多数据隐私需求,不一定有很强的意愿去用 Claude、GPT 这种模型。

曲凯:但我觉得一两家独大,好像目前看起来也不太会发生?

繁青:嗯…不好说。

曲凯:那如果模型真的能自己研发自己,为什么创业公司不直接做一个更好的基模?以及为什么这件事不是模型厂自己做?

繁青:我最近也在思考,所谓 RSI 基模和模型厂正在训的基模,到底是不是正交的。我目前认为,这二者其实是同一件事。所以创业公司去训 RSI 基模,或者去做 RSI 的 harness,都没有太大意义。

曲凯:所以实现 RSI 最核心的点是什么?我能不能理解,只要基模的 coding 能力越来越强,慢慢就能做到?

繁青:我现在对 RSI 的思考是,很多 self-evolving 的方法可以看成一个更聪明版本的 DFS。

DFS 这个算法就相当于让模型走迷宫,遇到死路时再回溯到上一个点。

但在 DFS 里,这个回溯是由代码判断的;而在 RSI 中,是由 LLM 判断的。

而 RSI 的「聪明」,主要就体现在剪枝上。剪枝其实就是要预判一个操作会带来怎样的未来状态,以及这个状态的收益。那在 RSI 中,剪枝的作用就是要让 LLM 把更多精力放到更可能的路上,提高 RSI 的效率。

从技术上说,这件事实现起来,核心靠两个东西:world model 和 value model。这二者在大模型预训练时,已经被内化了。这也是为什么我前面说,我觉得创业公司训「RSI 基模」不太成立。

之后 RSI 变强,一方面要看模型有没有把 world model 的知识内化得更好,另一方面要看模型的 context 窗口有多长。前者决定模型知道多少东西,后者决定模型能回溯到多远的地方。

曲凯:现在模型厂都在往 RSI 这个方向走。假设有一天模型真能做到算法自迭代,数据会不会又变成瓶颈?还是到时候数据也能自己转起来?

繁青:我个人觉得可以转起来。我们最近做的 RSI bench,其实就是在探索这件事。我们目前确实发现,agent 在数据层面展现出了一定的自进化能力,以及自行合成更好数据的能力。

曲凯:我们正好可以捋一下数据的几波发展。我观察到第一波是以 Scale AI 为代表的普通人标注,第二波是 Mercor 那种专家标注数据。合成数据可以理解成当下第三波趋势吗?

繁青:我觉得是,但可能已经在趋势的中后期了。

第一波数据需求更多是为了做预训练,这块目前的需求确实不多了。

第二波对专家数据的需求是 o1 推理范式带来的。这部分依然有需求,但不会像 25 年年初那么多。因为现在模型很强,对专家的要求也变高了。原来可能只要求专家做题,现在还要专家出题,而且题不能和市面上已有题重合,这就太难了。

第三波对合成数据,包括真人数据这块的需求,则是模型 coding 能力变强、开始有更强的 Cowork 能力之后解锁的,主要是为了提升模型的 agent 能力。

曲凯:现在不同类型的数据,大概是什么价格?

繁青:专家数据可能是一两千这个量级。贵的合成数据能卖到好几千,一般就是一条非常长程的任务。真人操控轨迹有时候要走量,就没有单条的说法,因为噪声比较多。

曲凯:合成数据模型厂自己也能做,为什么还要外采?

繁青:数据肯定是多多益善,而且模型厂自己造的数据会有自己人的 bias,所以希望从外面收一批高质量数据,补一下分布。

但合成数据的单子以后肯定会越来越少,主要是因为目前的 bench 越来越少了。

现在模型越来越强,做一个好 benchmark 的难度也非常高,最终可能只会剩下少数几个最好的 benchmark。这样模型厂就可以围绕少数 bench 自己造数据,对外部需求就会少。

曲凯:所以数据还有什么可以做的机会吗?会是什么?

繁青:短期看,可能就是 RSI 数据,比如我用一个模型去后训练另一个小模型。这样一条训练轨迹目前很稀缺,要跑出来也比较难,可能得有模型训练背景的人才能做。所以数据行业的门槛也在提高。

曲凯:所以这半年,包括你们在内的一些公司靠卖数据赚了很多钱,收入涨得蛮快。但你前面说,你觉得这一波已经快进入尾声了?

繁青:对,普通 agent 数据这一波确实已经接近尾声。数据行业变化非常快,也会筛选数据厂商。以前主要走重人力专家标注模式的公司,可能很难活下来。反而是数据公司里有一线 hands-on researcher,可能更能追上数据变化的潮流。

曲凯:但要做好 RSI 数据,就像你前面提的,还是必须自己真的去训模型。

繁青:对。但现在训模型基本约等于造数据。包括我们造数据的时候,也会和模型厂商有合作。

曲凯:我想起来,最近有个蛮流行的说法:「算法就是数据,数据就是 infra,infra 就是算法」。它戏谑之中好像又带着一点真相(笑)。你怎么看?

繁青:没什么毛病。

「算法就是数据」,是因为算法往往会收敛到最简单的形式。当大家都用同样方法时,差异就体现在数据上。

「数据就是 infra」也好理解,因为 infra 决定训练能不能更高效。

「infra 就是算法」,则是因为当我们要训大尺寸、长轨迹模型时,就需要 GPU 层面或者模型 context 层面的并行,才可以训下去。

在这三者之中,数据是核心的驱动力。

现在算法和 infra 的基础形态相对稳定,但它们会跟着数据的需求走。如果以后数据越来越难、推理一条数据都要一天甚至几天,infra 和算法层面也都会跟着改。

曲凯:明白。那你觉得未来大家还会需要更多数据吗?或者大家肯定希望有更多数据,但还能有吗?如果就靠合成数据,那合成数据有没有可能发展成类似无限数据?

繁青:无限是不太可能的。数据量不会毫无节制地提高。

不过高质量数据会一直变多。因为 agent 用户越来越多之后,会反哺出更好的合成数据,再反哺模型训练。而模型尺寸增加之后,模型的效果也会变化,输出的数据质量也会逐步提高。

曲凯:当大家聊到合成数据时,也经常会把它和蒸馏放在一起讲。怎么理解这二者之间的关系?

繁青:生成合成数据时,需要 agent 在一个环境里面探索。如果这个 agent 背后是 Claude 之类的外部模型,大家就会把这个探索过程看成蒸馏。

但蒸馏也分「硬蒸」和「有技巧的蒸」。

硬蒸就是造的环境太简单,比如就是让模型做普通数学题,老师做一遍,学生拿过来抄。

但如果环境足够复杂,对应的题和评分标准又是正确的、足够高质量的,那么搭出这一套环境和题本身就是有难度的。

曲凯:那为什么有些公司会强调自己不蒸馏?蒸馏的坏处是什么?

繁青:蒸馏有点像抄近道,可能会让你错过在主路上本来能发现的一些 insight。

曲凯:明白。所以现在 AI Lab 大概处在什么状态?之前大家会担心 scaling law 撞墙。你觉得现在对 AI Lab 里的人来讲,是沿着现有路线还有很大空间,还是需要新的架构和技术路线?

繁青:从年初到现在,coding 一直是大家最重要的发力方向。这块增长还是很迅速,但整体 pipeline 已经相对稳定。所以 AI Lab 也会探索其他技术路线,比如 auto research。Anthropic 和 OpenAI 现在也都在探索这块,可能是要服务 AI for Science。

曲凯:正好你提到 AI for Science。除了 Anthropic 和 OpenAI,很多人都在做,包括字节 Seed 前一阵也推了 100 个科学家计划。但 AI4S 似乎和模型并不完全处在同一层面上?那为什么大家开始在这上面发力?

繁青:一方面是因为 STEM 领域确实是模型 research 能力比较直接的应用场景。

另一方面,现在已经很难单纯靠常规 benchmark 展现模型智力提升了。AI4S 和让模型写 GPU kernel 一样,都是长程、高难度的任务,是直接衡量模型智力的好场景。模型厂也需要找到这些场景去 PR。

曲凯:就是大家已经要从奥赛卷到诺贝尔奖了(笑)。

最后问一个比较敏感的问题:蒸馏对于国内模型的表现,到底有多大影响?

繁青:我觉得蒸馏不是国内模型变强的决定性因素。

就像前面讲的,我个人认为国内模型变强更多来自底层架构和预训练上的创新。

蒸馏是后训练里的加速手段,但不是说没有 Claude API 就做不出来。国内自己的模型现在也很强了,可以用自己的模型做合成数据。而且国内人这么多,如果真下狠心做数据基建,也不见得做不出来。

蒸馏可以缩短我们追赶的时间,但并不是国模变强的唯一原因,更不是最底层的原因。

42章经

思考事物本质

跳转微信打开

Ambi 的技术理念

2026-07-19 22:32:00

Peter 2026-07-19 22:32 北京

以下文章来源于:过程即奖励

过程即奖励

因上努力 果上随缘

Ambi 正式开放内测。

我所相信的

产品就是我们的认知在这个真实世界的投射,上次说的是我们相信的,这次想说一下我们技术和交互上的选择和理念。

我们做 ambi 最大的出发点,在于智能平权的时代,我们希望改变 AI 跟人的交互方式,让人能够更大程度地使用智能。  所以我们做软硬结合垂直一体的硬件,我们做多端的产品,我们做实时交互让AI走到环境里来而不是异步互动,这些在这次内测都能体验。(注:软硬结合的产品用apple watch上的app来替代,只能达到我们自己硬件理想态的30%的效果)

除了这些,我们还有一个一直没有公开的一个功能——Sidekicks

我一直在思考一个问题:既然智能平权了,无时无刻地使用智能,真的就代表“最大程度”地使用智能吗?从第一性原理去思考,无时无刻地使用“尽可能多”的智能,才叫最大程度地使用智能。

我们现在看到很多产品,包括海外 Thinking Machines 做的 Real-time Interactive的产品和 Demo,遵循的是“Listen, Think, Act”的逻辑。但你会发现,它们都只会 Act 一个事情,和你互动。

这是不对的。

大模型刚出来也只能和你问答和你互动,但是现在是agentic时代可以给你做任何事情。同样,实时和你互动不应该只是和你说话问答,而是实时去 agentic的做任何事情。

从技术上来看,大家实现的方式是后面有一个reasoning模型,前面有一个负责语音互动的模型。但是,为什么是一个呢?为什么只能互动呢?我们从最本质的问题去思考,我们带着AI在现场,你希望这个AI只能和你聊天?你希望在现场的这个AI是2024年的ChatGPT?

所以,我们技术、产品、交互的判断和选择是,要让智能最大程度的服务人,应该竖切一刀,横切一刀:

竖切一刀 (Anytime, Any environment):在当下,任何环境都有智能随时服务你。

横切一刀 (Real-time Interactive Agents) :任何时刻,都有不止一个智能在同时服务你。

我们把这个叫Attention Loop,不是 Listen (see) - Think - Interact而是Attention - Listen (see) - Think - Act

参与内测的朋友,打开Sidekicks(伙伴)页面,创建一个新的伙伴,说出下面的咒语:帮我创造一个新的伙伴,当你在 Listening 的时候,帮我XXXXX (提出你想要的在过程中就帮你做好的任何事)

你就能实现:你不是带着一个 AI 在场,你是带着一群 AI 在场。

你在最大限度使用智能。

——分割线——

过去一年的时间,其实经常都会思考,到底什么叫世界级公司?什么叫 Global Company?是海外有很多人吗?真的是业务遍布全世界吗?直到我看到了 General Magic(通用魔术)的纪录片,我才真正找到了这个答案。

所谓的世界级公司,首先你得保证你是有世界级的心态:你觉得你是走在世界的最前端,你是在改变世界。你有勇气在创业的第一天,就觉得这段旅程无论成功与否,都是一段伟大的、值得被记录的旅程。

所以就在我看完《General Magic》(通用魔术)纪录片的那个晚上,当我想明白了什么是“世界级公司”的那个晚上,我联系了一位国际电影节的获奖导演,说:“你下周飞过来吧,你给我们拍一个纪录片,从我们创业最开始就记录下来。”

因为我相信,我们做的事情——软硬结合、垂直一体,改变人跟 AI 的交互方式,让人能更大程度地使用智能——是值得被记录的,而我们也在改变世界的路上。

所以3周前开始,我们就有导演一直跟拍我们创业的全过程,明年也会做一个90分钟的大银幕片子,去申报国际电影节。因为时间太仓促了,只有四周的时间,我们刚好撞上了产品发布,所以导演只完成了深圳的采访,也剪了一个小的样片。希望通过这个小的样片,可以让大家看到我们的一些想法和愿景。短片里面还漏了我们在SF、在北京、在上海、在西安办公室的同学,以及和大家一起努力创造的场景,后续都会陆续更新。

在上一家公司,我一直有一个愿望:既然我们在记录语言,而语言是最古老的事情,为什么我们不能开一个博物馆,去记录那些大模型无法识别的声音、大模型无法做到的事情?但因为各种原因,我的这个想法最终并没有落地。

后来,我盯着ambi的 logo 发呆,越看越喜欢。它像一座桥,像一块小小的玉,也特别像一个充满生命力的小把件——就像一个可以随时系在你的腰带上、放在你的身上跟着你、随时可以把玩的可爱物件,和我们的产品一样。

所以在那一刻,我给我们负责装修的小伙伴发了个微信:我们 7 月底新装修、新搬的办公室里,需要有一座窑。

对,你没看错,就是景德镇的那个窑。

所以以后来我们办公室参观、合作,甚至只是拜访路过的朋友,你都可以在我们提前准备好的、跟我们 logo 形状一样的土坯上,画上你喜欢的釉色。然后我们会在窑里烧好,再寄给你。

希望你烧出来的这个瓷块和我们的产品一样,值得把玩,穿越时间。

当然,我猜我们也有幸能够成为第一个办公室里有窑的 AI 公司。(傲娇! 就是啥都要争第一!

Feishu Docs - Image

有的时候不得不感叹时间的奇妙。配图是凯凯和技术同学在北京发版完,早上 5 点的北京的样子。(而我小时候最喜欢挂在嘴边的,就是凌晨 4 点的洛杉矶。)

更有意思的是,我上一次这样的通宵达旦、这样的夜不能寐、这样的在乎一个产品,恰恰好是我跟凯凯刚认识的时候,也是 13 年前我创业米公益的时候。而就在上周,我们米公益被收购、退还给投资人的所有股票都已经解禁,彻底走完了一个轮回。命运和时间总像在无意中画下有意思的连接。

我们又找回了激情。

似乎又来到了一个新的轮回。

就在刚走完上一个开始于 13 年前的轮回的时候。

而这次出发的理由,恰好和上一次一模一样,我们想改变世界。

Feishu Docs - Image

诚邀想改变世界的朋友加入我们。

可以关注我们的公众号 :关于下一代 AI,我们正在寻找另一种答案

当然,你也可以直接找我。

跳转微信打开

AI 发展了 4 年,把应用发展没了?| 42章经

2026-07-19 22:32:00

原创 曲凯 2026-07-19 22:32 北京

谁不爱打逆风局?

23 年的时候,大家不知道 AI 行不行,我们还在探讨的是 AI 到底是一波多大的机会,该对标什么,以及相信 AI 的也没有办法看清模型和应用之间的关系如何,像 Character.ai 的模型和应用一体的模式一度成为了最优解,最后的结果是市场在摸索中浅尝辄止地投资模型和应用在内的 AI,谁拿到的钱都不算多。

24 年上半年的时候,整体 AI 都很凉,市场连模型带应用一起质疑,记得 24 年 4 月份 GPT4o 发布的时候,市场反响平平,今天回头看我们才知道 4o 对开启推理和 Agent 的跨时代的意义。直到 24 年下半年,整个市场开始回温,尤其在应用市场表现最明显,也许可以称之为一种价值回归,从那个时候开始,市场开启了为期两年的大厂高 P 的创业时代,夸张点说,字节里每个产品线中最有能力的口碑最好的人是谁,可能一些投资人都要比张一鸣本人还更了解。

25 年开端,大家开始讨论模型算法是阶梯上升的,预训练不再 scaling 了,算法撞壁了,本来市场可能会发生一次剧烈的回调,但 deepseek 和 manus 横空出世,生生为模型和应用续上了一条命,这一年里,字节的高 P 几乎是出来就能靠团队和故事连融三轮。

到了今年,26 年,智谱、minimax 接连上市,很多业内的人觉得这是一个见顶的信号,觉得智谱会重蹈上一波 AI 四小龙的覆辙,甚至有人觉得其市值跌到发行价的几分之一才算合理,同时 Openclaw 爆火,也有很多人觉得应用又会迎来一波类似 manus 的大浪潮,在今年上半年,全国可能有上千个公司和团队同时在做 openclaw 相关的创业项目。

但到了今天,结果是,模型的势能达到几年来最强,而应用市场的冷度跌回谷底,甚至是比谷底还低。随之而来的变化是,有的机构跟我说谁还看应用啊,有的机构说应用赛道已经死了,而有的机构投了十多个世界模型的项目。

“不看应用了”,“应用赛道死了”,这个说法是我从业十多年从未听过,也从未想过有一天会听到的话,但它就真切的发生在了今天的市场上。当技术脱离应用、甚至把应用打死了,这个技术到底算是个什么技术。

回头看,不得不承认,市场在奖励早年选中了模型的人,虽然我也仍然觉得模型最终会被 commodify,但短期内模型的价值显而易见,如果这是一场竞赛,那模型已经把应用打的只剩了最后一格血,是的,我并不觉得应用死了,但似乎是真的已经濒死。

我最近见了很多有点颓废的应用创始人,他们在转型,在想该怎么办,在庆幸账上还有钱,在尝试各种解法,却唯独没有想要再出来融资的,因为所有人都在跟他们讲,我们不投应用了。

这里面有客观事实的原因,比如模型吃掉一切的显著证据,比如投资人的非理性、盲从和 FOMO,但我也经常和创始人讲,这次真的不能只怪投资人。

相似的市场、相似的技术,美国的模型能力还显著更强,但我们看到了很多美国市场中 ARR 上亿美金的应用公司,而国内可能甚至找不出几家 ARR 上千万美金的公司,这里的原因是什么呢?

过去几年,我们跟所有的创始人说,你要做海外市场,创始人在融资的时候也对所有投资人说,我要做海外市场,这套话术似乎变成了一种融资时候彼此的默契,但真的做起来,有多少人是在表演型创业?有多少人在内网发英文的宣传视频,最终用户变成了翻墙的中国人?

因为 Token 成本的问题,因为付费意愿和能力等的问题,做海外市场这个大家默契下的说法自然是有其正确性在的,但最终因为创始人的选择、能力和既有惯性等原因,真正做到这点的十不足一,而我们看到的真的坚决出海的公司往往真的有让人惊讶的成绩,比如上过我们播客的 Dify、WorkMagic、Ace Studio 等公司都默默做到了千万刀的 ARR,这里面还包括出国后整个面貌焕然一新的 Meshy 等等。

海外的空气真的更香吗,我相信并不是的,但海外的付费意愿和能力是真的强,这是我们必须要承认的客观现实。

所以,我是真的希望应用公司能更加争气,交付更多的结果出来,不管 Manus 和 Liblib 这类的公司承受了多少争议和骂名,我也始终觉得他们是应用中的一些硕果仅存的代表公司,也真心希望他们能发展的更好,甚至在未来能反向夺回模型现在所侵占的市场和声量。

再讲回模型市场这几年的发展,我觉得最有趣最值得研究的几家公司并不是 Anthropic 或 OpenAI 或 Deepseek,其实是智谱和 google,智谱从似乎落后到第一,google 则是从落后到全民看好再到今天被大家放弃,这都是在一两年内发生的事情。这些似乎都是在模型市场中反复发生的可验证的事情,到今天为止我仍然不觉得模型的战场已经结束了,明天的智谱会不会是今天的 google?Anthropic 能半年超过 OpenAI,是不是也能半年又落后?

我们只能说今天应该已经没人像 23 或 24 年那样质疑 AI 这波机会的体量,但我们也仍然处于 AI 剧烈而动荡得快节奏变化的中早期阶段。

智谱的唐杰老师前些天的公开信中提到“DeepSeek R1 的出现,标志着 Chat 范式的探索已经基本结束,而智谱是在后 DeepSeek 时代的模型训练范式中押中了 Coding 和 Reasoning”。

我觉得智谱今天的成功回头看,除了战略的胜利、人才密度的胜利等等之外,同时也有一定的运气因素,但凡他们的多模态或 C 端应用能做的好些,是否会、是否能这么专注的赌中 Coding 的机会呢?

但不论如何,chat 时代胜利的是 OpenAI、是 Deepseek、是字节豆包,Coding 时代暂时胜利的是 Anthropic、是智谱(OpenAI、Kimi 等其他公司在快马加鞭地追赶),但下一个时代也已经明显到来,唐杰在同一封公开信中说,未来要压住的是长程任务、是自治智能体等,而海外的 Claude Tag 和 GPT Work 也竞争的飞起。

我们对模型的进展和竞争局势的理解总是有很强的滞后性,腾讯的混元和 workbuddy 能在这里弯道超车字节吗?智谱还能持续领先吗?Deepseek 又会充当什么角色?一切都仍然言之过早。

那在这个市场情况下,应用创业者们该如何自处?

要回答这个问题,我们先引申出另外一个老生常谈的话题,那就是投资到底是投人还是投事儿,比如市场中经常讲 IDG 就是典型的投人风格,红杉则是投事儿投赛道的风格。

在我看来,事儿变得快的时候就只能投人,事儿已经稳定了那就可以投事儿,所以越早期的市场往往人的权重越高,越后期的市场甚至职业经理人反而能呈现更好的结果。(说句题外话,如果如此,那红杉为什么投资做得好?我的答案是因为有钱,因为可以全行业全阶段覆盖。早期批量撒,后期精准补枪,就能解决一切的问题。)

所以今天的应用创始人,第一,我反而觉得是处于历史上最好的时候,因为竞争没了,泡沫没了,可以真的回归用户、回归产品、回归初心,这就像 23 年和 24 年初市场给我们的感觉一样,逆风局打的才有意思,噪音多了泡沫多了,难免劣币驱逐良币。(我们经常开玩笑讲,如果把 23 年上过 42章经 播客的创始人都投一遍,最终的回报表现可能优于大多数基金,这也侧面印证了市场最终也是会奖励在低谷期或者说非共识阶段敢于出来的创业者的)

像大厂高 P 这个标签中就很容易混入一些其实在当下不那么适合创业的人,大厂高 P 创业本质上是一种信息套利,但信息套利也分两种,一种是对锤子的,即对模型的了解,另一种是对钉子的,即对用户需求的理解,但 ai 时代信息套利的空间被大大压缩了,而且锤子已经明显溢出了,钉子却不足,未来我们希望能看到更多从钉子出发的产品和项目。

第二,大家要默认我们就是要随波逐流,随模型的波,逐资本的流,要默认我们今天做的事情中只有一部分是值得坚持的,更多还是要锻炼团队、锻炼组织,要不断地转型和寻找新机会,要不断地尝试如何用更新更好更智能的方式来服务同一批用户和解决同一类问题。

第三,不要为了融资讲故事,一切还是要回归到用户和问题上。我们可以褒义上的随波逐流,但不能被市场逼迫到把自己从良币变成劣币。

Ambi 的创始人莫子皓,在做一个通过软硬结合的方式改变人类现有和 AI 交互方式的产品,让智能真正平权,这两年我跟他聊 AI、聊硬件学会了一件事,就是把很多事情反过来想。

大家做许多产品让人去问大模型,并且让大模型去给答案,

我们选择让大模型主动问人并且主动给出答案。

大家做许多产品让大模型和人对齐,一步一步引导大模型产出好结果,

我们选择让人和大模型对齐,让大模型引导人一步一步问出好的问题。

所有人都在服务使用工具创造价值的人,程序员 / 设计师 / 文档使用者,

我们选择服务用对话来创造价值的人,销售 / 顾问 / 非文档使用者。

前阵子他融资的时候,我下意识的给他建议说可以讲讲模型的故事,他问了我一个问题说,我随时可以招到很好的算法的人,我们自己团队其实也有训模型的能力和经验,但为什么现在这个节点要做模型?是啊,他们工程上做的非常好,产品体验也很好,未来的某个节点也会做自己的端侧模型,但今天为什么要讲模型?就因为要融资吗?我最终还是说不出口。所以反过来想,就因为资本热点是模型,讲模型做模型就是对的吗?

一切最终还是回到那句话,所有公司终会回归到用户价值的实现上。

Manus 曾经经历过 5000 万美金估值聊遍市场没有人投资的时刻,经历过达到 1000 万美金 ARR 还被拖延和压价最终不到一亿美金估值的时刻,风水轮流转,足够强的团队总能在夹缝中寻找到机遇,最终打一个漂亮的翻身仗。

就像 Codex 桌面应用负责人在最近一期播客中所说的:“今天的所有产品和创始人,都是模型的期权”。今天的积累会在未来的某个时刻兑现,随着模型更成熟,期权会逐渐变成有价值的资产,而重点是在这个过程中,期权不要清零。

最后,再说下我对于今天整体 AI 是市场的判断。

我们看到二级市场 AI 硬件供应链中惊人的涨幅,我们看到智谱的万亿市值,我们看到具身、世界模型等领域仿佛回到了 2021 年的 SAAS 市场,我们也看到字节等公司中炒股实现财富自由退休的案例,这些是否是市场走到一个阶段性尾声的标志呢?

我不知道当资本从语言模型、图片模型、声音模型、视频模型投到世界模型之后,还能有什么故事可讲,也不知道具身和世界模型能什么时候会真的落地,但我相信一些世界运转最底层的规律和常识,比如合久必分、分久必合,市场不会有一家公司长期独大,一家模型公司不可能长期在万亿、十万亿甚至百万亿的路径上走下去,并吃掉一切,我也相信当大多数人都隐隐觉得这个市场好像有些不对劲的时候,那就真的是有些不对劲。

历史上,我们其实经历过 IBM 用 MIPS 的模式收 CPU 算力钱的时代,经历过运营服务商通过短信和流量赚的盆满钵满的时代,而我们正在经历英伟达产业链和模型公司通过 token 赚钱的时代。运营商在短信和流量上赚了接近十年的钱,AI 从 GPT 3.5 算起到今天已经接近 4 年的时间,且其演进的速度明显快于历史上任何一个周期,那未来市场会如何发展,token 免费、智能平权的时代是否很快就会到来?到那天是不是又会有很多人讲模型赛道没了,我们现在只看应用?

正如经济学家卡萝塔在她的《技术革命与金融资本》这本书中所说,历史上几波大的科技革命都经历过导入期(其中包括爆发期和狂热期)、转折点(即泡沫破裂,典型就如 2000 年的互联网泡沫)、最后再到展开期(即技术真的落地,真的走入经济、社会的各个角落)。

那如果 GPT 3.5 代表了爆发期的开始,今天我们是否已经站在了狂热期?转折点距离我们到底还会远吗?

思考事物本质

42章经

跳转微信打开