非官方 · 中文社区资讯站 · 追踪 jev-1.13

Jev:不生成文本
AI 判断模型

TypeSafe AI 的旗舰 System One 模型——输入 state 和一批类型化问题,返回带校准概率的结构化答案。代码直接分支,无需解析自然语言,成本仅为 LLM 的零头。

System One:为软件而生的快思考

名字源自 Kahneman《思考,快与慢》:System 1 快而直觉,System 2 慢而深思。LLM 是 System 2——擅长生成,但被拿来当分类器用时又慢又贵还得解析。Jev 是第一个 System One 模型:只做快速、结构化的判断,概率经过校准(说 0.8 的事,约 80% 会发生)。

训练 RLCD,第三条路线

RLHF 造出聊天机器人,RLVR 造出推理模型,而 TypeSafe 用 RLCD(RL for Calibrated Decisions)训练模型输出「决策 + 校准概率」而非文本。CEO Diogo Almeida 正是 RLHF 的共同发明人(InstructGPT)。

形态 单次前向,无自回归

所有问题在同一请求内并行且互相隔离评估,一个前向算完所有答案,所以输出 token 免费、延迟以毫秒计。实测 11 个问题一次调用约 0.3 秒、0.0002 美元。

哲学 机器接口 > 聊天接口

TypeSafe 的赌注:未来 AI 自动化 99% 是机器对机器。问题必须原子化(专家几秒可判断),复杂判断拆成多问、权重逻辑放在你的代码里。

三种原语

问题三要素:id(仅代码用,不发给模型)、instructions(要判断什么)、criteria(选项/量表定义)。三类可自由混在一个请求里,加问题几乎不增加耗时。

Choice 选一个

从固定选项中选一个,返回 choice + 每选项概率 + confidence。适合路由、分类:工单分派、文档类型、意图识别。答案永远约束在你给的选项内。

Score 量表打分

沿有序量表定位,返回 score(可落在两档之间)+ 分布 + confidence。适合严重度、情绪强度、质量分级——档位含义由你定义。

Noul 是 / 否

返回「是」的概率(0–1)。适合概率本身有用的场景:是否退款请求、是否包含 bug 报告。注意:Noul 没有独立 confidence 字段,概率即信号。

定价与规格

当前版本 jev-1.13.0,别名 jev-latest。只收输入 token,输出免费。

项目规格
价格$42 / Btok(即 $0.042 / Mtok),仅输入计费,输出免费
限速250,000 tokens/秒 · 1,200 请求/分钟(官方称动态调整中)
上下文64k 总预算;state + 最长问题 ≤ 32k(约 15 万字符英文)
输入纯文本:string / JSON object / array;不支持图像、音频、视频
语言英文最准;中文等 CJK 可用但精度偏低,务必自测
微调不做客户级微调,靠 state 塞领域材料 + criteria 写规则 + 代码加权
💡 批量实测:13 个问题合并 1 次调用,比拆 13 次单独调用便宜 12.2 倍、快 10 倍且答案不变。大胆用 Speculative Fan-out——把可能用不到的问题也塞进去。

五分钟上手

去 console.typesafe.ai 拿 API key,一个 POST 就能跑起来。

curl -X POST https://api.typesafe.ai/v1/systemone \
  -H "Authorization: Bearer $TYPESAFE_API_KEY" \
  -H "Content-Type: application/json" -d @- <<'EOF'
{
  "state": "Our Stripe integration has been
    failing for 3 days and we can't ship
    any orders!",
  "model": "jev-latest",
  "questions": {
    "department": {
      "type": "choice",
      "instructions": "Which team should
        handle this",
      "criteria": {
        "billing": "Payment issues",
        "technical": "Bugs / integration",
        "sales": "Pricing questions"
      }
    },
    "is_urgent": {
      "type": "noul",
      "instructions": "Does this convey
        urgency?"
    },
    "frustration": {
      "type": "score",
      "instructions": "How frustrated is
        the customer",
      "criteria": ["Calm", "Frustrated",
        "Very angry"]
    }
  }
}
EOF
# 返回:类型化答案,代码直接用
{
  "answers": {
    "department": {
      "choice": "technical",
      "probabilities": {
        "technical": 0.93,
        "billing": 0.05, "sales": 0.02 },
      "confidence": 0.88
    },
    "is_urgent": { "noul": 0.999 },
    "frustration": {
      "score": 1.62, "confidence": 0.79 }
  },
  "usage": { "input_tokens": 312 }
}
Python:pip install typesafe-sdk(≥3.10),TypeSafeClient().system_one(state=…, questions={…}),自动读 TYPESAFE_API_KEY。JS 用 @typesafe-ai/sdk

四大架构模式

官方 Patterns 文档总结的高频用法——把大判断拆成原子问题,组合逻辑留在代码里。

Fan-out 投机式扇出

把所有可能用到的问题一次发出(含投机问题),代码按需取用答案。反正并行、便宜,宁滥勿缺。

Gating 置信门控

confidence 是第二决策轴:高置信自动执行、中置信请人确认、低置信转人工。阈值随风险分级——转账要 0.9+,查余额 0.5 就够。

Scoring 复合打分

复杂评级拆成多个 Score(如 bug 严重度 × 客户情绪 × 可复现性),在代码里加权合成。调权重改代码即可,不用改 prompt。

Routing 意图路由

先 Choice 分类用户意图,再路由到确定性代码 / 专家 LLM / 人工。让 90% 的简单请求根本不碰大模型。

已知短板(官方自曝)

TypeSafe 公开了 jev-1.13 的 jaggedness(能力毛边)清单——这份坦诚在业界少见,也是用好它的关键。

  • 不会数数、不会算术、不会比日期——这类活全部放代码里,模型只做语义判断
  • 读字面意思——双否定、多跳间接、隐含条件都会答错;指令要写到你"解释给自己听"的程度
  • Context rot——state 里塞无关内容会掉精度,先在代码里过滤再送
  • 无注入防护——state 里的 prompt injection 会带偏答案,外部内容当数据要设防
  • 无结构不变性——P(noul) ≠ 1 − P(¬noul),不同原语间的阈值不可互相搬用
  • Score 刻度数值弱——别用分数插值还原精确数值,只拿来过阈值
  • 不能生成文本——需要生成请出门左转找 LLM,或用正则/生成模型给选项、让 Jev 挑

生态追踪

发布一个月内 GitHub 上已涌现一批项目(星数为 2026-09 中旬快照)。

SemIf

用开源模型在本地 3090 上复刻 semantic if,独立项目。

★ 1535

awesome-jev-by-typesafe

官方精选:用例、模式、prompt、起步代码合集。

★ 507

jev-review

用 Jev 做分级代码审查的工作流 + 本地面板。

★ 261

typesafe-mario

Jev agent 玩超级马里奥:结构化模拟器状态 → 按键决策。

★ 260

pg-jev

Postgres 扩展:用自然语言查你的数据表。

★ 154

jev-browser

用 Jev 驱动浏览器操作,一次往返定操作 + 目标。

★ 89
社区爆款 Demo:用 Jev 玩 Doom(结构化实体状态 → 每帧按键决策),HN 发布帖 1886 分。Claude Code 用户可直接装官方 skill:claude plugin install typesafe@typesafe-ai

动态时间线

本站持续追踪 Jev 与 System One 赛道的公开动态。

生态爆发:一个月 1500+ 星

SemIf、pg-jev、jev-review、typesafe-mario、foreman 等项目集中出现;开源复刻(mini-jev、Qwen-2.5-1B-RLCD)也相继跟进。

第三方实测:校准信号「真实可用」

lindfors.no 用 24 篇挪威语听证信实测:0.31 秒、约 $0.0002/次;关键发现是「它答错的题,恰好也是它 confidence 最低的题」——不确定性信号值得信任。

HN 发布帖 1886 分,Doom Demo 出圈

「Introducing System One Models and Jev」登顶 Hacker News;实时打 Doom 的 Demo 引发热议,也有对延迟对比口径的质疑。官方回应:coding 场景(state 工程)尚未开做。

TypeSafe 发布 Jev 与 System One 模型类别

jev-1.13.0 上线,定价 $42/Btok、输出免费;官方同步放出文档、Python/JS SDK、四大 Patterns 与 Playground。

常见问题

Jev 能替代 LLM 吗?

不能,也不打算。它是生成层的互补:LLM 负责生成,Jev 负责路由、验证、打分、门控这些「每秒成千上万次的小判断」。官方建议用 confidence 门控决定什么时候升级到 LLM 或人工。

和「LLM + JSON mode」比强在哪?

三个字:快、便宜、稳。单次前向毫秒级返回;$0.042/Mtok 约为最便宜聊天模型的零头;概率是训练目标(校准)而非副产物,且带现成的 confidence 供门控。

适合哪些业务?

意图路由、内容审核、工单分类、RAG 重排、风控打分、agent 动作门控、数据抽取校验——凡是「规则写不死、LLM 又太贵」的判断点。

中文能用吗?

可用但官方明说英文最准,CJK 精度偏低。生产使用前务必用自己的中文数据实测,并重点盯 confidence 做路由兜底。