Jev创始人:“造产品、不造神”,追求“极致可靠性”,Jev将逆转“软件灭绝论”

华尔街见闻09-29 10:38

“自动化到底去哪了?AI已经聪明到令人难以置信,但在其他所有事情上却毫无用处,这简直是个悲剧。”

近日,TypeSafe创始人Diogo Almeida在a16z播客中直言,AI编程工具只是让代码写得更快,软件本身并未变好。OpenAI自2020年起尝试自动化客服至今未果,根本原因在于AI与软件“各走各路”。

在与a16z联合创始人Ben Horowitz与合伙人Martin Casado的对谈中,Diogo阐述了他对当前AI困局的判断,以及公司爆火的AI决策模型——Jev试图解决什么。

他表示,Jev——一种将智能嵌入软件内部的新编程原语,能让程序能理解意图、做出概率决策。Diogo认为极致可靠性是一切的前提,并将“极致可靠性”视为Jev的核心,主张“造产品、不造神”。

Diogo判断SaaS公司将是AI浪潮最大受益者之一,“软件灭绝论”将被逆转。而Jev的终极目标是:让所有技术都能“做到你的意思(do what I mean)”。

Diogo Almeida

“自动化在哪里”:AI的能力与落地之间的鸿沟

Diogo认为,现有的AI编程工具——无论是Claude Code、Codex还是Cursor——写出的代码,本质上和10年前没有区别。

不管你用多少AI编程工具,软件本身其实并没有变好。也许你写得更快了,但可以说反而变得更糟了——因为监督更少了。

更具体的例子:OpenAI自2020年起就在尝试自动化客服,至今仍未实现。“这很疯狂,我们有这么强的财务激励去自动化这些事情,但就是没做到。”

在他看来,问题的根源不是数据,也不是模型能力不足,而是AI与软件之间始终“各走各路”——AI输出自然语言,软件处理结构化指令,两者从未真正对接。

Jev是什么:嵌入软件内部的智能原语

Diogo将Jev定位为一种全新的软件原语(primitive)——嵌入代码内部的智能层,而不是替代软件工程师的工具。

我想要的不是自动化软件工程,而是扩展软件本身能做的事,让那些本该可以自动化的东西,真的能被自动化。

Jev的做法是提供一个新的编程原语(primitive)——开发者可以用自然语言描述意图,给它一个状态机,它会以一定的置信度决定做什么。

这就像一个你可以用自然语言描述需求的库,你给它一个状态机,它会带着置信度去选择该做什么——这种能力以前从未如此普及过。

他用一个类比解释与编程智能体的区别:编程智能体擅长语法,但在语义上很差,在架构上更是糟糕。Jev解决的是另一个层面的问题——让软件内部能够理解意图,而不只是生成文本让人去解读。

Diogo也坦承Jev的本质:“Jev绝对是一个分类器。分类器本来就是为了有用而设计的。”他认为,Jev的能力可能已经超过2019年一支专业MLE团队为特定任务构建的窄模型。

极致可靠性,是一切的前提

Diogo反复强调,Jev的核心竞争力不是性能,而是可靠性。

可靠性就是这个东西的全部。如果你不理解这一点,就很难做出一个真正能抄走的竞品——它不是靠跑分就能复制的。

他对可靠性的定义分三层:

  • 可用性(uptime/SLA):这是基础,类似SLA,系统能不能跑起来

  • 鲁棒性:每次调用都能表现出相似的智能水平——不是严格的确定性,而是“每次都足够聪明”。

  • 可信赖性:“做到你的意思(do what I mean)”,开发者能依赖它,不需要反复给样例查询,直接信任它。

可靠性的最高荣誉,是让开发者在使用Jev时不需要提供示例查询——当你直接信任它的时候,你就会进入一种心流状态。

他也直言:“我们本可以更早发布。我不认为人们意识到这一点。但它会带来那种'我可以信任这个东西'的感觉——这是一台反挫败感的机器。”

“造产品、不造神”:与主流AI叙事的分歧

Ben Horowitz点出了TypeSafe与其他AI公司最显著的不同:“我最喜欢你们说的一句话——'我们造产品,不造神'(we build prod, not god)。”

Diogo对此直接表态:“我不认为我们走在通往递归自我改进(RSI)的路上,我现在不这么认为,以前也不这么认为。”

他将当前AI行业的悲观叙事归因于“单一模型的迷信”——相信一个超级大脑能统治一切。“这是人们听到的,但这不是现实。”

他的判断是:OpenAI定义的AGI——“自动化大多数经济上有价值的工作”——在技术上是可实现的,但行业走错了方向。

自从RLHF之后,AI行业就分裂成了巨大的过度承诺和交付不足。因为人类在评估模型好坏,模型看起来很好,但我们一直在优化这个评判者,而不是自动化本身。

他的目标更朴素:

我想要的是'做我的意思'(do what I mean)。想象一下,如果所有技术都能做你的意思——这不是科幻,看看AI有多聪明就知道了。

SaaS“逆末日”:软件灭绝论将被反转

编程智能体出现时,市场一度担忧SaaS公司将被颠覆,估值大幅下跌。Jev出现后,SaaS公司的反应却截然相反——普遍欢迎。

Diogo的解释是:SaaS灭绝论的前提——“软件便宜且容易复制”——从未真正成立。

大量的东西发生在底层,软件提供的价值并没有消失。

他认为SaaS公司将是AI能力落地的最大赢家,原因有三:

  1. 他们最了解用户工作流,知道什么值得自动化。

  2. 他们已经触达了大量用户,分发成本已经支付。

  3. 他们有能力将Jev嵌入现有产品,真正提升软件能力,而不只是加一个聊天框。

我认为这将是一场逆末日。我对此非常兴奋。

他举了一个具体的愿景:多选表单将会消失,取而代之的是软件直接理解用户意图。“'做我的意思'将被推向全新的高度。”

访谈全文如下:

Jev如何将AI转化为真正能做事的软件

a16z播客节目

a16z的Ben Horowitz和Martin Casado与TypeSafe AI创始人Diogo Almeida坐下来探讨一个简单的问题:AI已经变得极其强大,那么自动化究竟在哪里?

Diogo认为,编程智能体或许能帮助我们更快地编写软件,但它们产出的软件在本质上仍与以往无异。TypeSafe正在用Jev走一条不同的路:将智能嵌入软件本身,使开发者能够构建出可以理解意图、做出概率性决策的程序,而非仅仅生成文字供人解读。

他们探讨了:为何可靠性是让AI真正可编程的关键、这将如何开启概率性软件的新时代,以及为何成熟的SaaS公司可能在其中占据特别有利的位置。归根结底,Diogo的目标很简单:打造能够可靠地"按我的意思去做"的技术。

第一章:开场

Ben: 自动化到底在哪里?AI聪明得令人难以置信,但在其他事情上却如此无用。

不管你用多少AI编程智能体,软件本身其实并没有变好。也许你写得更快了,但可以说反而变差了。

Diogo: OpenAI从2020年就开始尝试自动化客服。我真正想要的是智能软件——我想拓展软件本身的能力边界,让那些本应可以自动化的事情真正实现自动化。

Ben: 我最喜欢你们说的一句话是:"我们构建产品,而非造神。"太好了。因为换作其他任何一位大型实验室的领导者,即便内心充满热情,也会将一切都包裹起来。但你的视角截然不同。

Diogo: 没错,我们要创造一个更美好的世界,原因是多方面的、细致入微的。我不认为我们正走在通往递归自我改进(RSI)的道路上,那种"SaaS末日"的故事我也不认同。

第二章:认识Diogo与TypeSafe

Ben: 今天,TypeSafe的创始人兼领导者Diogo来到我们节目。他对Martine和我来说都是英雄式的人物。他不仅在打造一款真正有趣的产品,更在推动一场我们认为极具重要意义的运动。所以今天我们非常兴奋。欢迎你,感谢来到节目。

Diogo: 谢谢。

Ben: 也许你可以给我们简要介绍一下——Jev是什么?TypeSafe是什么?为什么它很重要?

Diogo: 好,我来说说。其实有人让我做过电梯演讲,但我通常会东拉西扯、表现很差。不过我意识到,我对Jev最喜欢的一句电梯演讲就是:自动化到底在哪里?

这真的令人深感痛惜。这么多的智慧,AI如此聪明绝顶,却在其他事情上如此无用,令人扼腕。我并不是要抨击聊天机器人或编程智能体,我自己也很喜欢它们,但在其他方面它们就是帮不上忙,这很悲哀。

我们有这么多璞玉浑金,却没有被打磨成能用于工作的利器——这正是TypeSafe要做的:为软件打造AI。我们希望让AI不仅仅对参与循环中的人类强大,更能真正构建实际可用的软件。Jev是我们在这个领域的第一个模型,目标是让自动化变得更好、更好、更好。

Ben: 是的。这件事之所以有趣,是因为它在软件界引发了轰动。我们认识的每一位开发者都打电话来说:"这太厉害了,太棒了,又快又好,方方面面都提升了。"但大家也会问:我们不是已经有Claude Code、Codex这些工具了吗?有什么区别?这又怎么能带来真正的自动化呢?

Diogo: 我真希望手边有张好看的示意图,因为我有一张特别喜欢的图来解释这个。我很欣赏Claude Code和Codex,也喜欢Gary Tan对它们的描述——"即时软件",这是形容它们所做之事的绝妙方式。它们能即时生成软件,让你可以用自然语言来编程,并且拥有与传统软件相当的表达能力。

但我想要的是另一种东西——智能软件。我想要的不是自动化软件工程,而是拓展软件本身的能力,让那些本应可以自动化的事情真正实现自动化。用更生动的语言来说,我想要表达"意图"这个概念,我想扩展我们能够表达和实现的词汇边界。

编程的本质,是对有价值的事物进行超精确的规格化定义,然后无限复制。这太了不起了,我只是想让这一切变得更多、更好。

第三章:智能软件,而非更快的代码

Ben: 哦,有意思。所以,一种理解方式是:你说的不是用一个更快、甚至可能不如人类的工具来替代软件工程师,而是说——不不不,我们要给现有的软件工程师装上超级引擎,让他们能写出更好、更有趣的东西。

Diogo: 对,就是这样。其实我觉得很多人都忽略了这个要点,它如此微妙,却又如此重要,值得细细道来。

如果你使用Claude Code、Codex或Cursor这类工具,它们确实能写代码,但写出来的代码本质上跟人类写的没什么两样——也许更好,也许更差,但基本上还是10年前那种样子的代码。

而Jev的意义在于,无论你是用Claude Code还是自己动手,你都多了一个新的基础原语——一个新东西,可以嵌入你的代码中,真正拓展软件的能力。所以它不是生成代码,而是被包含在代码之中……

Martin: 对,而且这是一个非常强大的基础原语——但它也与程序员惯常的思维方式有些不同。例如,它引入了概率的概念,这是一种嵌入在软件内部的智能层。

Diogo: 是的。可以这么想:这有点像一个库,你用自然语言描述你想要什么,给它一个状态机,然后它会以一定的置信度选择做什么——这种方式在以前并不像现在这样普遍。

这里面有很多值得深挖的地方。我想先说一件事:我非常热爱"自动化到底在哪里"这个问题的方向。我很爱写软件,恨不得整天写。当然,我不推荐任何人去当CEO,不管怎样。

而且这件事确实很疯狂——AI这么厉害,但软件10年来几乎没变,没有人能把这两件事调和在一起。我们能做的最多是在旁边加一个聊天机器人,能执行一些操作,但不是所有操作,因为有些操作还不可靠。

我想回到刚才那个关于"思维方式有所不同"的观点。是的,我认为机器原生的东西与代码并不能完全精确匹配——而这恰恰是我们正在努力的艺术所在。在新员工入职第一天,我会画一张韦恩图:AI擅长什么、代码中什么是有价值的,而我们就在两者的交集里。

所以我们不会输出像推断浮点数这样的东西,因为AI在这方面确实很差。但像概率这样的东西其实并不新鲜,这就涉及到了"Jev只不过是个分类器"的争论。

Jev绝对是一个分类器。分类器很厉害,它们本来就是为了实用而设计的。它们是被设计来让系统正常工作的,这和某些机器学习概念的接口是一样的——因为这些都来自于那些努力让系统实际运转的实践者。

而我现在看到的是,Jev实际上——我的猜测是——可能已经比2019年专门组建一支MLE团队来为你做这些事情更强了,而且你可以即时编程配置它。谁知道还能构建出什么,因为2019年能构建窄任务系统的优秀MLE团队并不多,要收集数据集、评估效果,这一切都很难。而这才刚刚开始。

Martin: 我感觉在这方面还有很多可能性。顺便问一下,你认为这里存在一个滑动条吗?一端是"语言输入、语言输出",就像我们今天有的;另一端是"现有的命令式程序",然后你可以在两者之间移动。还是说,你认为"语言输入、状态机输出"这个点,将会在设计空间中作为一种通用工具固化下来?

Diogo: 这个问题很棘手。说说我心里的答案——我心里的答案是,它确实是一个滑动条。

在为产品设计各种属性时,我可能因为个人偏好犯了一些错误。但目前,"每美元的智能量"是我的北极星指标——当然这不一定是对的,"每秒的智能量"在短期内可能更有价值。

但就连我们的接口设计——把输入称为"state"(状态),也是有意为之的:它就是程序内部状态的一部分。在我的内心,我们其实在为更复杂的程序内部状态排列方式做大量优化工作。

能不能把智能放进去?我认为这将是一场永无止境的探索。我们在设计上非常用心,同时从实际角度看,某些事情自然而然会发生——比如在毫秒级做出AI决策会更容易实现,所以它在一段时间内会更像数据库,而不是标准库的东西。但我也很希望它有一天能成为标准库的一部分。

第四章:Diogo的成长历程与AI观

Ben: 能不能退一步,聊聊是什么造就了Diogo?你的说话方式既像AI研究员,又像系统工程师,还像程序员——而这些通常是交集很少的群体。你把AI——一个我们一直朝着"类人存在"方向推进的东西——变成了程序员的工具。能不能聊聊你的个人经历?

Diogo: 我进入AI的经历有些非同寻常。我曾是一名数学竞赛选手,还获得过奖项。怎么描述呢……我的数学好到足以追到女生,这已经相当厉害了。

Ben: 真有这回事?

Diogo: 千真万确。所以你得练到相当高的水平。

Martin: 那数学这么好,能追到什么样的女生?这点我们的听众需要了解。

Diogo: 不行不行,我们要激励年轻人嘛。

Martin: 年轻人,别学这个。保持帅气、随性、有趣就好,不要用才华来弥补什么。

Diogo: 哈,我不敢相信我说了这些。总之,我是数学竞赛选手,但说来有点惭愧,我其实从来不喜欢数学,也从来没有认真努力过,只是大池塘里的小鱼。数学对我来说始终只是被设定好的竞争道路,我痛恨它,因为它只关乎赢得比赛。

后来我发现计算机科学其实很像数学,但更酷、更有用、更有趣。我至今仍然热爱出算法面试题,那对我来说是最美好的事情之一。它既让我享受其中,又能非常好地考察出别人的能力。所以我热爱计算机科学,我认为自己首先是一名计算机科学家,而不是AI研究员。

我真正进入这个领域,是因为我赢得了一场Kaggle竞赛——不是靠复杂的数学,而是靠把自动化做到极致:更多的嵌套循环,更多的……就像用解决系统问题的方式来解决它。

这最终让我被迫在NeurIPS上做演讲——通常这是一种荣誉,但我讨厌它,因为我只想埋头干活。

Ben: 那是Kaggle比赛那次吗?

Diogo: 是的。那次Kaggle竞赛的主办方是Isabel Guyon,她是SVM的共同发明人——应该是第一作者,但我不是百分之百确定。她看出我是那种不太融入学术圈的人,便收留了我,引导我认识了AI圈里的各种人,我的职业轨迹就这样被推向了这个方向。

Martin: 然后是OpenAI?

Diogo: 不,先是Jeremy Howard创办的一家初创公司。

Martin: 真的?

Diogo: 是的,我很喜欢Jeremy。然后是Google Brain,待了一段时间。再后来退休了一阵子,最终觉得无所事事挺烦的,便想:AI其实真的很有意思,于是就加入了OpenAI。结果非常好,真的非常好。

Ben: 太了不起了。你刚才说了一句在当今世界极为罕见的话:"AI真的很有趣。"而贵公司的气质和对AI的看法,也和其他人如此不同。我最喜欢你们说的一句话是:"我们构建产品,而非造神。"太好了。换作其他任何一位大型实验室的领导者,即便内心充满热情,也会把一切包裹遮掩起来。但你的视角截然不同。

你说:不,我们要创造一个更美好的世界,而且这会非常棒,不仅不会减少工作岗位,反而会增加更多、更好的岗位,所有人都会有美好的未来——和你在一起,能感受到你是真心相信这一点的。

所以,请告诉我们,TypeSafe和Jev对我们来说不仅仅是一家公司,更是一场朝向积极未来的运动——而这正是AI世界里大多数人不太买账的方向。

Diogo: 是的,或者说他们根本不理解这一点。那种"Jev只不过是个分类器"的抱怨,完全是ML层面的担忧——而其他人都在狂欢,因为大家都在想:这太了不起了,我们终于可以做我们一直想做的事情了!

如果你不真正了解开发者,就很难理解正在发生的事情。我完全同意。我确实认为有一幅相当负面的世界图景在流传,而我显然不认同。

我认为这根本上来源于一种"单一超级模型"的迷信——每个人都相信一个无所不能的大脑能统治一切。

Martin: 那听起来更加不祥,那才是人们脑海中的恐惧。

Diogo: 没错,人们就是这么理解的。但那个"一个大脑"真的在统治我们所有人的路上吗?我们连许多基础性的事情都还没有自动化——而那些事情恰恰是我们不应该让人去做的。

有很多非常基础的工作还没有被自动化。而每当现实与这种叙事脱节时,我感到非常痛苦。这种脱节的一部分,正来自于"自动化到底在哪里"的追问——AI明明这么聪明,自动化的经济激励又这么强,但现实就是如此落后。

这种现实与AI潜力之间的落差,让我感到真正的痛惜,也是我一直希望能做点什么的驱动力。现在,我们终于发布了Jev,对我来说感觉像是一场派对的开始。使用Jev的开发者们是快乐的AI群体,没有用的则是愁云惨淡的那群——这确实是一种非常有趣的对比。

Ben: 这让我想起今早和我们成长基金负责人David George的一段对话。我们在聊新工具,我问他有没有试过Perplexity的Muse,他说超好用。我问他用来做什么,他说:"我终于取消了《纽约时报》的订阅。"我说,那其实挺难做到的。但这不过是冰山一角——有大量烦人的事情等待被自动化。

第五章:这只是数据问题吗?

Diogo: 我认为,如果我们真的要诚实地面对自动化这个北极星目标,就不能重蹈AI一直以来的覆辙——过于聚焦于异常值和演示。

很多人问我最喜欢的使用场景是什么,但我都不确定那些场景是否真的有效。我希望它能在后台默默运行,让人可以放心信任它,不需要随时盯着它,也让别人可以在上面叠加构建。

与此同时还有安全性——这是另一种层面的安全:如果你希望它真正拿到资源、获得访问权限并执行任务,你需要保障,或者至少是统计层面的保障,确保它不会失控。

当然,我不认为我们的模型很快会失控,除非有人专门写软件来实现这一点——那将是一个非常酷的壮举。但不管怎样,这不是我们应该负责的方向。

Martin: 我很好奇,这个直觉酝酿多久了?我记得我们大概在2017年聊过……

Diogo: 对,我们确实聊过。那时我谈到了数据的重要性,以及专注于任务的想法。我就想问,这一切是早就知道会走向分类器,还是只是一种直觉——觉得看待整个AI运动还有另一种方式?

说来有趣,2017年的那场演讲其实有类似的主题,好像叫做"理论上模块化、实践中灵活"——非常软件风格。所以我在这方面算是相当一致的。

我认为这一切真正开始,是在ChatGPT发布之前不久。当我们发布那些模型的时候,我对此并没有什么预感,说实话,我甚至对RLHF的泛化能力感到非常惊喜。

Ben: 那是什么时候?

Diogo: 大概是2021年底,2021年四季度。那个泛化能力真的很强——如果你读过那篇论文,它跟其他那些试图自证观点的论文不一样,我们是真正用接近科学方法的方式,尽力去证伪——比如,这是不是某种作弊?

我最喜欢的一个测试查询是:"冥想前先吃袜子为什么重要?"我们提前确认了这句话没有出现在互联网上,而模型居然能给出看起来合情合理、像人类回答的答案。这件事在团队里触发了那个点:这不是作弊。

在ML中,你永远要小心作弊的可能性。然后让我真正受挫的是,我们发布了那个模型——我是坚定的能力推进者,为发布那个模型做了很多工作——我真心认为那个模型有相当大的概率是AGI。但当它没有达到那个程度时,我的整个世界观都崩塌了,我问自己:为什么?

Ben: 所以那时候你其实在某种程度上是"疯狂列车"上的人?

Diogo: 也不完全是。我只是觉得RLHF泛化得相当好,也许我们已经有AGI了。RLVR是那个我目前看来泛化不太好的东西。

说到AGI的定义,在OpenAI早期——大概2020年——人们会把AGI描述成"伊利亚(Sutskever)和每一个if语句"。但那只是一个有意模糊的概念,让所有人都能站在这顶大帐篷之下,共同奋斗。

而我——出于细致入微的理由——不认为我们走在通往RSI(递归自我改进)的路上,我现在依然不这么认为。

但我确实认为,OpenAI所定义的AGI是完全可以实现的——"自动化世界上大多数有经济价值的工作"。这其实听起来……有大量工作摆在那里,其中很多是非常机械、简单的重复性工作。要想把工作外包出去,你需要的是简单易懂的指令,而这种水平的智能,在模型里早就具备了,已经有相当长一段时间了。

而让我感到耿耿于怀的是:为什么这些东西还没有被利用起来?

自RLHF以来,AI行业基本上走向了一种巨大的"过度承诺、交付不足"模式。GPT-3在当时其实还算比较准确的,但因为人类是评估模型好坏的裁判,而模型在人类评估中表现得很好,所以看起来一切都很棒——但我们一直在优化的是这个"裁判"本身,而不是自动化能力。这才是那个缺失的东西。

所以,正是从那时起,它真正击中了我——为什么这个东西不更有用?

Martin: 所以你认为,衡量标准应该是:你能在多大程度上自动化真正有生产力的任务?这就是你所说的"过度承诺、交付不足"所指的维度?

Diogo: 在我心里,这关乎的是酷炫的科幻愿景能否成真。我认为,自动化真实任务的能力,是衡量那个科幻愿景的"煤矿里的金丝雀"。

你真的告诉我数学已经被解决了?甚至两年前GPQA(谷歌防作弊问答)就被解决了,但我们还是搞不定得来速点餐?这两件事很难同时在脑海里自洽,而且我认为很多人对此没有好的答案。

第六章:使用案例的广度

Martin: 我能测试一个想法吗?也许不太对,但——真实世界的分布难道不是和数字世界不同吗?真实世界是重尾分布,有很多例外情况,我们也没有相应的数据。会不会正是因为我们没有那种分布的数据、没有在那种分布上训练,所以AI才基本上只局限于数学或代码这样的低维流形?

Diogo: 我不完全买单这个数据论点。我相信确实存在长尾,否认这一点会很荒谬。但我认为,在"煤矿里的金丝雀"这个场景里,我们并不需要自动化那条长尾。

我认为我们在一切事情上都需要极度务实。构建可靠的软件永远是一种投入,就像……程序员的三大美德是什么?懒惰——不愿重复做同一件事;傲慢;还有第三个……

Martin: 对对,我记得这是Perl时代的东西……还有第三个。

Diogo: 对,我也记不清了。但它说的是那种懒惰——愿意花10小时去解决一个5分钟的任务,让它从此不再需要手动完成。这应该是一个ROI决策,对那些想做自动化的人来说。

我只是希望让自动化成为可能,而我相信人们会由此创造出新型工作——就像"穿牛仔裤的Jev"这样的角色。但作为一个基准,我觉得验证"AI看起来应该能自动化的事情,是否真的能自动化"是有价值的。

OpenAI从2020年就开始尝试自动化客服,到现在还没成功——这真的很令人震惊,也很匪夷所思。

Ben: 而且公司内部,现在真正被自动化的事情也很少,大多数项目都没有成功,除了编程这块做得非常好。

能不能帮我们分类一下,哪些类型的问题现在更容易自动化?这很有意思,因为我们在本轮生成式AI浪潮之前就研究过客服问题。你去拜访一家公司,他们会说"我们解决了95%的帮助台来电",听起来非常多,但你仔细一看数据,发现基本上全是密码重置。如果按问题的独特性来分,可能也就50%左右。

所以当你面对人类和自然系统时,就是有这种无尽的异常长尾。

Diogo: 是的。说起来,大概每隔一小时就有人找我说"我在用Jev做这个新的应用场景",让我大跌眼镜。所以,你问到我有没有预见到这么广泛的应用场景——我没有预期会这样。这次发布是没有人能预料到的,谁能预料到可能真的有点疯狂。

就好像我们没人能预料到ChatGPT这个面向普通用户的东西,而这是面向开发者的版本,感觉又奇特了一层。我甚至不知道参与"Jev派对"的人里有多大比例是开发者。我无法想象非开发者怎么用它,但就连我那些非开发者朋友也都在Twitter上狂欢、发表情包,完全投入其中。

好,第一点——太棒了。第二点——这很难用简短的话来传达,因为这背后是多年来的血汗与泪水。我对可靠性的执着程度,是非常、非常高的。可靠性就是这个产品的灵魂所在。如果你不理解这一点,就很难做出一个在基准测试上看起来差不多的仿制品。

我觉得,可靠性的每一个"九"都会对所有人都无比宝贵——即便它不是市值上最值钱的东西,因为它将开启新的应用。我们正在为各种奇特的可靠性数量级而战,有些我们自己都还没完全搞清楚,因为我们就像是在把AI的智能引擎装进人们的工作站,让他们去发现它能做什么。

Martin: 可靠性在这里具体是什么意思?是模型的可用性、调用时返回同样的结果,还是别的什么?

Diogo: 好问题。对于一个本质上有随机性的东西来说——

第一种是可用性/SLA,不太是这个。第二种更接近于确定性。第三种,我会称之为健壮性——每次都有相似的智能表现。

不完全是确定性,因为确定性对单元测试有用,但对真实系统不够用。比如,你在提示词里加一个UUID,它在功能上是相同的,但结果不会完全一样。还有另一层我还不知道该叫什么——也许可以叫某种智能:不需要每次执行完全相同的操作,但每次都需要是聪明的。如果换你处于那种情况,这是一个人类能理解的合理判断吗?开发者可以在此基础上进行编程。

对我来说,可靠性的最高荣誉,将是达到这样一个境界:开发者可以不写任何示例查询,直接对Jev编程——因为他们完全信任它,进入那种"心流状态"。

Martin: 这让我想到,有了这样一个基础原语,编程智能体的价值其实在某种程度上反而下降了——因为就算Codex帮你写了所有软件,但那个软件里没有用上Jev,软件本身的能力就是有限的。反过来,即使你不用编程智能体,只要用上了这个通用基础原语,写软件也会变得更容易。

你觉得未来是编程智能体来使用Jev,还是更多是人类主导?

Diogo: 这更像是一个关于编程智能体的问题,而不是Jev的问题。我的感受是,我没有像自己希望的那样深入使用它们,你们两个可能比我更常用——这让我有点遗憾。

但我的经验是,它们在语法层面非常厉害,在语义层面则相当差,架构层面更是糟糕。

Martin: 对,架构方面非常差。

Diogo: 而架构对我来说是软件中最具人类创造力的部分。所以我很喜欢用编程智能体,我认为Jev大概率还不在它们的训练分布里——如果它们真的训练了我们的用户数据,那可就吓人了,大概率没有。

但当Jev进入它们的训练分布之后,我认为让它们来处理语法没有任何问题。至于架构,也许模型并不是一无是处,而是处于第50百分位。如果你对架构本来就不懂,也许这就够用了。这些都是灰色地带的权衡。有时候速度才是你公司或项目最需要调的那个旋钮——你愿意接受第50百分位的架构而不是第60百分位,换取更快的速度,让Codex连夜跑完。

第七章:SaaS末日,反转了

Ben: 说到这里,市场上已经出现了一个有趣的现象:当编程智能体出现时,人们喊着"SaaS末日来了",所有SaaS公司的估值都跌穿了地板。但当Jev出现时,每家SaaS公司都在说"这是有史以来最棒的东西"。怎么解释这个反转?

Diogo: 我觉得这很自然,没什么好多说的。

在SaaS末日的叙事里,我认为真正站不住脚的论点是:软件非常便宜,而且也许很容易被复制。前者我还能相信一些,后者我完全不信,因为大量的价值是在引擎盖下发生的。也许我在这里有些过于迷恋软件了。

Martin: 我们都是。

Diogo: 好吧,好吧。所以我不认为那个叙事成立了。SaaS提供的价值似乎和以前一样,也许市场只是被吓到了。

我认为SaaS将是整个AI游戏中最大的赢家之一。我非常希望与那些最大、最"无聊"、最了解用户痛点的SaaS公司紧密合作,因为它们最清楚哪些工作流该被自动化、用户真正需要什么——这就是它们的核心竞争力。

软件永远是一种资本投入,但你提前花钱,是为了让体验变得更好,然后将这种提升分发给所有那庞大的用户群体。所以我认为,从能力维度来说,这将是一场"逆末日"。我好兴奋,我得给它起个名字。

Ben: 对,得有个名字。"SaaS嘉年华"?

Diogo: 听起来有点太欢乐了。

Ben: 所有SaaS应用都将突然变得大幅更有用。而且,一家SaaS公司的大量资本投入,其实就是触达所有客户。如果你已经触达了所有客户,然后不是仅仅在产品上加个聊天机器人,而是让软件本身变得更好、更好——那将是一件了不起的事。

我不知道这是不是一个现实的梦想,但我觉得有这样一个可能的世界:那些多选框表单会消失。我感觉它们就像是在把自然语言映射到软件早已能处理的结构化输出——只是换了个包装。

Diogo: 而且严格来说,这个概念来自80年代,我们那时候叫它"第四代语言"(4GL)。你还记得吗?

我认为"做我的意思"(Do What I Mean)将被推向一个全新的境界。如果我能举一个Jev应用的例子——我不确定是否足够可靠,所以不敢打包票——但有个人用语音来控制电脑,系统不断实时判断:这是一个命令,还是要插入文本?插入的是什么文本?这听起来就是极度酷炫的东西。界面可能将彻底改变,当然我们还需要让它更便宜、更快。

Ben: 那就到星际迷航的境界了。

Martin: 这里有一个深刻的直觉:如果你今天用AI来生成软件,你创造的仍然是和以前一样的软件。但你看大公司里一个普通的PR,平均大概10行代码——我们真的做过这个研究。所以你自动化了10行代码,而且这10行代码可能还只是某次客户学习的体现。

你优化的其实是一件相当微小的事情,而且它并没有给软件带来新的能力——你只是在自动化这个本来就很小的事情,在极限情况下,意义相当有限。

但现在,有了这个新能力,软件本身真的可以变得更好了。

Diogo: 对。而且说实话,在没有Jev之前,我从来没有想到:不管你用多少AI编程智能体,软件本身其实根本没有变好。也许你写得更快了,但可以说反而变差了,因为监督变少了。

Ben: 而且往往更不安全。

Diogo: 对,肯定的。但现在,你真的可以说:应用将因此获得新功能,因为这个你提供的新基础原语,它能理解自然语言,能够推理,并且将这种能力与状态机结合起来。

如果人们能把这个作为最大收获,那将是对我们工作的最大称赞。我感觉,把现有的三种逻辑门扩展到更多,几乎是一种过于宏大的愿景——在我们的类型体系里,有些类型就像是同一种逻辑门,但里面有一个小小的大脑。如果这真的成为TypeSafe留给世界的遗产,那将是一件对世界来说极其重要的事情。我不会过度承诺,但我会为此而战。

第八章:应用层还是系统底层?

Martin: 有一个问题:在像状态一致性、持久性、真正系统级别这些需要提供强保障的严肃场景里,这个能走多深?

分析日志、分析邮件、提供UI、与人类对话——这些肯定没问题。但随着时间推移,这会不会变成像智能数据库一样的东西?甚至……空中交通管制系统——这也是我们真正需要的。

Diogo: 确实有点可怕。我的哲学一直是:先自动化容易的,再自动化困难的。但我也认为,一个全新的概率性编程时代将被打开。概率性编程其实有很长的历史,基本上在70年代就消亡了……

Martin: 我对这个很熟悉。其实你也可以把Jev叫做一种神经符号系统。你的联创Eric来自那个背景,他跟我聊过贝叶斯方法。

Diogo: 对,他在生物领域做了很多工作,时起时落。但我的意思是更广泛的东西。我的品牌是实用主义,极度的实用主义。我不太喜欢生物启发的东西,我认为它从来没有真正奏效过——它有用处,是能激励疯狂的人们工作几十年,直到某天真正突破,再被工程化打磨。AI神经网络的故事确实如此,但很多关于它"为何有效"的解释其实并不准确,比如分层特征提取确实奏效了,否则残差连接就不会有用——但这是另一个话题。

从系统的角度来说,我对这部分并不感到个人兴奋——不是因为不好,而是因为编程起来实在太复杂。但我为这个世界感到兴奋:当我们在不同成本和速度之间拥有大量不同层次的智能时,那些真正的系统狂人会在极限情况下做出各种疯狂的权衡——Jev对他们来说可能太智能了一千倍,他们只需要一个近似的信号来做一个近似的路由判断。

这将是极度疯狂的东西。而好消息是,我们可以再次重建系统——我们有了新的基础原语,这是思考软件的全新方式。我们对互联网做过这件事,从大型机到客户端-服务器架构也做过,我们周期性地就会这样做。

而且,仅仅因为网络安全问题,我们大概就需要重建几乎所有系统,只是为了让它们安全。

Ben: 这一点对关键基础设施来说尤其明确。

Martin: 你在思考Jev的应用时,更多是从应用层、SaaS、分析的角度,还是从系统底层的角度,还是全部都有?

Diogo: 我有一点自己的看法。我的思考框架有点像TCP/IP的底层——UDP不可靠,TCP太可靠,介于其间……

说到我为什么关注"每美元的智能量"——我是从AI驱动的经济革命、AI无处不在的科幻愿景倒推过来的:所有软件里都有AI,满世界都是。我问自己:在这样的世界里,所有对AI的调用中,有多大比例是"为了人类消费"的——需要文体、需要风格,等等?在极限情况下,这个比例其实很少。

从同一个问题出发:有多少调用会在第一层,有多少会在深层底层?我认为极大多数会在底层,但会从第一层开始。而如果你不去瞄准底层,你会很难到达那里。

我认为很多人没有意识到,AI与软件之间是如何"在夜晚擦肩而过"的。即便你试图把AI嵌入软件,它的行为也会很怪——因为软件本来不接受自然语言输入。你在提示词里塞进去你要的JSON格式和schema,它就是不听。最终你只能把输出交给人类,或者再交给另一个LLM——那就是智能体的while循环。

所以从第一性原理来说,只有两条路:人在循环中(聊天),或者智能体(while循环)——因为自然语言需要被反复输入回另一个模型。

我见过太多人经历这种"悲伤的五个阶段":拿起AI,打算嵌进软件,然后是否认、愤怒,最终走向接受——算了,我就把它交给另一个LLM,交给人类吧。

而我认为,这是第一次,我真正看到:你可以拿一个LLM,拿AI,把它真正地映射到一个状态机,并且高效地做到这一点。

当然,我不想过度承诺。我不知道它是否已经为所有那些被过度承诺的应用场景做好了准备,但我的团队会为此而战,我们真的非常非常在乎可靠性。

第九章:可靠性与"做我的意思"

Diogo: 我们本可以早得多发布。我不认为人们意识到这一点,也不认为他们会从Twitter上的讨论中意识到。人们大概永远不会真正理解,但它就会有那种感觉——哦,我可以信任这个。所以它是反挫败感机器。

"做我的意思"——对我来说,这关乎世界的流畅度:让一切都更顺畅地运转,像齿轮咬合一样紧密联动。我其实有一整套"AI乌托邦愿景",分布在不同的维度上。"做我的意思"是其中非常重要的一部分——想象一下,所有的技术都按你的意思运作。那不是科幻。看看AI有多聪明,不是吗?

Martin: 确实令人惊叹。也许这就是我们今天最好的收尾之语了。

Ben: "做我的意思"。我喜欢。谢谢Diogo,这是一次很棒的对话,非常享受。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Comments

We need your insight to fill this gap
Leave a comment