Jev 到底解决什么问题?
现在的 AI 很会说话。但软件里还有大量判断,没人交给它做。
官方文档开头就写明了他们的赌注。大多数 AI 产品是围绕「模型和人对话」做的,TypeSafe 押的是另一边:大规模自动化会以 AI 对 AI、AI 对软件为主,机器接口比聊天接口重要。
We call this Machine Native Intelligence: AI with software-like properties such as structure, reliability, observability, testability, speed, consistency, and low cost.
官方文档 · AI Primer
他们预期大规模的 AI 自动化会更接近 99% 机器对机器、1% 和人交互。设计目标就是照着这个比例定的。
三条训练路线
| 路线 | 官方定义 | 产出什么 |
|---|---|---|
| RLHF | Reinforcement learning from human feedback。把预训练模型变成聊天机器人,训练它产出人类偏好的回答。 | 聊天式的回答 |
| RLVR | Reinforcement learning with verifiable rewards。做出了推理模型,数学这类任务很强,但更慢、更贵。 | 推理过程 |
| RLCD | Reinforcement learning for calibrated decisions。训练模型返回决策和校准过的概率,而不是生成文本。 | 决策和概率 |
三条定义来自官方 AI Primer 页。RLHF 被用来训练 InstructGPT 和 ChatGPT,它的共同发明人 Diogo Almeida 现在是 TypeSafe 的联合创始人。
RLCD 在优化什么
官方把它的输出契约写成了三条。
- 模型不生成文本。
- 它返回决策,以及每个决策的概率。
- 概率越高,答对的几率就应该越大,这是整套方法的核心假设。
第三条就是「校准」。官方给的解释很具体。一个校准良好的模型给出 0.2 的概率,那么这一类预测里应该有大约 20% 真的发生;给 0.8 就是 80%;给 1.0 就是 100%。
注意这描述的是「一批预测」的整体表现。
它不保证任何单个答案正确。这一点很重要,后面还会碰到。
RLHF 有什么问题
RLHF teaches a model to say things that people prefer. That objective works well for chatbots, but it can also reward sycophancy and confident-sounding hallucinations.
官方文档 · AI Primer
官方还提到一个更隐蔽的副作用,叫 mode dropping(模式丢弃)。模型会学会偏爱某种风格,比如「听话、照做」,同时把其他可能输出的概率压下去。它是 GAN 里 mode collapse 的温和版本,症状比后者轻得多。
An output can be compelling to a person without being reliable enough for unattended automation. Human preference and machine trustworthiness are different optimization targets.
官方文档 · AI Primer
TypeSafe 的联合创始人 Diogo Almeida 在演讲里把这套逻辑讲得更直白。
他说 RLHF 的目标是取悦循环里的人,所以它在「有人参与的任务」上极强,而「把这个人从循环里拿掉」的那类任务,它做不到。
他把这个分歧叫做辅助和自动化的分歧。
所以怎么选,取决于你的场景。人和 AI 来回对话、最后人来拍板,现在的聊天模型已经够好。服务器上跑、没人盯着、错了要你自己担,那就是另一种模型要解决的问题。Jev 押的是后者。
看看别人怎么用 Jev
事实来源
下面这些是官方文档,本页所有事实性描述都可回溯到这里(其他内容站的说法未经核实,我们不用)。