快速上手 · 立刻调用 Jev:读完原理想直接上手的读者,可以通过第三方托管网关 EasyJev 接入官方 Jev 模型——邮箱登录即可创建
sk-密钥,官方typesafe-sdk只需把base_url指向https://api.easyjev.online、api_key换成站点密钥就能调用;按站点声明,响应结构与官方 API 完全一致,jev-latest在服务端锁定为 jev-1.13.0,计价与官方相同(输入 $0.042/M token、输出免费)。它是独立于 TypeSafe 的第三方托管服务,采用预充值计费、充值目前需人工处理、无 SLA——适合个人试验与轻量集成,生产级用量请同时评估官方直连渠道与第四节的开源替代方案。
from typesafe_sdk import Noul, TypeSafeClient
# 官方 typesafe-sdk,只改两处:api_key 与 base_url
client = TypeSafeClient(
api_key="sk-your-easyjev-key",
base_url="https://api.easyjev.online",
)
result = client.system_one(
state="User asks: can I get a refund for order #1024?",
questions={"refund": Noul(instructions="Is this a refund request?")},
)
print(result.nouls["refund"].noul) # "yes" 的概率,例如 0.97
本文是一份带审计痕迹的调研笔记,成文于 2026-09-29(Jev 发布后第 14 天)。信息来自七个并行研究通道:TypeSafe 官方文档与发布博客逐页抓取、多个独立检索代理分头调研(原理 / 应用 / 开源生态)、主线程对核心一手来源的精读与交叉比对。文中对关键论断标注来源脚注,并区分三个可信级别:〔官方〕=TypeSafe 一手页面;〔独立〕=第三方实测或学术审计;〔社区〕=多方转述但未能直接核验。Jev 发布仅两周、信息环境嘈杂,部分数字(已逐一标注)存在来源冲突,引用前请自行复核。
一、Jev 是什么:两周引爆的”决策专用模型”
Jev 是旧金山公司 TypeSafe AI 于 2026 年 9 月 15 日发布的闭源托管模型,自称首个 “System One Model”1。两处命名各有来历:”System One” 取自 Kahneman《思考,快与慢》的快直觉系统2;”Jev” 取自经济学家 William Stanley Jevons——Jevons 悖论:效率提升反而推高总消耗,寓意”决策变便宜之后,AI 会被嵌入远多于今天的决策点”13。
公司 2024 年成立、隐身开发约两年,出隐身同日宣布 DCVC 领投的 4000 万美元种子轮(投后估值约 2 亿美元)34。创始人 Diogo Almeida 的官方履历为 “co-invented RLHF and InstructGPT…previously Google Brain”5;其 InstructGPT 论文共同作者身份(作者表第 4 位)已通过 arXiv 原文独立核实6,TechCrunch 称其约 2024 年离开 OpenAI4。团队其他成员包括 COO Sasha Sheng(前 Meta/FAIR)与 CTO Erik Gafni(Ravel 创始人)5。
一句话定位:不生成任何文本、专做”带校准概率的类型化决策”的非自回归模型——输入一段 state(文本/JSON)加一组问题,单次前向并行返回所有答案及概率,端到端 70–500ms、输入 $0.042/百万 token、输出免费〔官方〕17。
发布后 10 天内的事件时间线(含可信度标注):
| 日期 | 事件 | 确认度 |
|---|---|---|
| 09-15 | 发布(early access/waitlist),同日官宣 $40M 种子轮 | 〔官方〕1 |
| ~09-16/18 | 上架 Vercel AI Gateway | 〔社区〕8 |
| 09-18 | TechCrunch 报道;OpenRouter 上架 typesafe/jev-1.13 |
〔官方/媒体〕49 |
| 09-20 | 开放注册、$5 免费额度(约折合 1.2 亿输入 token) | 〔社区,二手确认〕10 |
| 09-22 | 传因需求过载暂停新注册(官方文档与 TechCrunch 仅侧证) | 〔未直接确认〕34 |
| 09 月底 | 限流 250,000 tokens/s、1,200 req/min;现役版本 jev-1.13.0 | 〔官方〕7 |
生态热度罕见:截至 09-29,GitHub 上 “jev” 相关仓库超过 3000 个、同名 awesome 列表至少 18 份(最热的 yibie/awesome-jev 收录 400+ 项目、分 17 大类)11;Vercel 称其为 “AI Gateway 历史上被最快采用的模型”——上线 24 小时内采用量为此前任何模型发布的 2 倍以上,约 13% 付费团队在用〔官方〕8。TechCrunch 报道 Vercel 内部用其替换分类器后快 5–18 倍4——注意:广为流传的”18x”数字即出于此(媒体转述),Vercel 官方博客本身只背书”最快被采用”。
二、原理篇:架构、机制与训练
2.1 接口契约:三原语与”类型化决策”
Jev 唯一的调用入口是 POST https://api.typesafe.ai/v1/systemone〔官方〕12,三种问题原语构成整个类型系统〔官方〕13:
| 原语 | 语义 | 答案空间 | 返回 |
|---|---|---|---|
| Choice | 相对判断(哪个最符合) | 调用方声明的选项 map,上限 255 个,选项语义用自然语言描述 | choice + 全选项 probabilities(和为 1)+ confidence |
| Score | 有序量表 | 2–10 个带描述文本的等级 | 概率加权平均分(可落在两级之间)+ 分布 + confidence |
| Noul | 绝对判断(二值命题,Bernoulli 语义) | 任意自然语言命题 | 单个 0–1 概率(二值分布由单值完整刻画,故无 confidence 字段) |
官方 SDK 的典型用法〔官方〕12:
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
with TypeSafeClient() as client:
response = client.system_one(
state=ticket, # 任意文本 / JSON / 文本数组
questions={
"department": Choice(
instructions="Which team should handle this?",
criteria={
"returns": "Exchanges, wrong or damaged items",
"shipping": "Delivery status, delays, lost packages",
"billing": "Charges, invoices, payment problems",
},
),
"is_urgent": Noul(instructions="The message conveys urgency"),
},
)
(想跳过官方注册流程直接试验的读者,可使用本文开头推荐的 EasyJev 托管网关——官方 typesafe-sdk 只改 api_key 与 base_url 两个参数,即可接入官方 Jev 模型。)
Score 的返回示例能说明其语义:probabilities: {0: 0.0, 1: 0.57, 2: 0.43} 时,score = 0×0.0 + 1×0.57 + 2×0.43 = 1.43,可以落在两级之间〔官方〕13。约束方面:state 加全部问题合计 64k tokens、state 加单个问题 32k;仅支持文本(无图像/音频/视频);同一请求的所有问题针对同一 state 一次性并行评估,”增加问题几乎不增加响应时间”〔官方〕713。
2.2 基础架构:官方披露了什么,黑盒了什么
必须先承认一个关键事实:TypeSafe 没有发布技术论文,未披露参数量、backbone、tokenizer、预训练数据与损失函数——官方发布博客里多个技术 FAQ(训练数据来源、为何需要新训练算法、公开基准)只有标题没有正文;这一点被 Wikipedia 与 Kai Waehner 两处独立确认314。官方给出的全部架构描述只有三句话级别〔官方〕1:
- “a new model architecture + parallel sampler“;
- “outputs all probabilities in parallel instead of autoregressively generating by token”;
- 创始人在 HN 发布帖(实测 1986 分 / 520 评论)中的补充:”strings are not allowed at all — this is how we make sure all outputs can be computed in parallel”(彻底禁止字符串输出,这是并行可计算性的来源),架构细节 “close to the chest”,并批评 constrained decoding “simply masking logits is insufficient”15。
开源旁证下的架构推断〔以下为推断,非官方确认〕:Jev 的行为契约——输出空间在调用时才定义、概率直读、并行回答——与”encoder 侧联合编码 state 与选项文本、读选项 logits/分类头”的结构在计算形式上同构,而这正是整个开源复刻生态的共同做法:
- 开源替代 Laya(GitHub,约 2.8 万 star,Apache-2.0):英文版用 ModernBERT-large encoder(421M 参数)、多语言版 mmBERT-base(322M),所有问题和选项一次前向一起打分,约 33ms/题1617;
- SemIf(原 OpenJev):加载 Qwen3.5-4B,对每个选项文本直接读首 token logits 做 log-softmax 归一化得分布,无需解码循环18;
- 先于 Jev 的学术同类 GLiFormer(DeBERTa-v3-large,575M,标签在推理时传入,仓库建于 09-11)与 GLiNER(2023)构成”标签即时定义的零样本分类 encoder”家族1920;
- 学术复现 this-that-model-1.0(2B 参数):答案”从指定位置的隐藏状态直接读出”,单张消费级 GPU 上 30.9ms21;
- 对”Jev 及两个开放权重 Jev-like 模型”的对照研究直接将其决策头称为 “constrained decision head”,并指出其中一种实现是对整个选项文本片段做 mean-pooling 后读出——且托管版 Jev 表现出与开放复现完全相同的行为模式(这间接支持其 encoder + 选项打分头的家族归属)22。
一条反向线索值得记录:创始人在 Latent Space 播客自称内部为压低单决策成本做了 “absolutely disgusting things”(暗示量化/多模型路由混合体,”Frankenstein’s monster”),且训练数据全部合成23。所以”Jev = 某个干净的单体 encoder”未必成立,更可能是模型组合系统,但其行为契约等价于上述结构。
2.3 底层原理:为什么能”一次前向”出决策
核心只有一步替换:把输出空间从”词表上的下一个 token 分布”换成”调用方声明的选项集上的分布”。
- 自回归 LLM 的输出是长度为 N 的 token 序列,需要 N 步解码循环,输出 token 逐个计费;Jev 的输出是维数等于选项数(Choice ≤255 / Score ≤10 / Noul =1)的概率向量,解码循环消失,输出天然免费、天然 schema 合规。
- 由此,”零幻觉”的准确含义是由构造保证的类型安全(官方原话 “Schema matching is guaranteed”):模型可能选错合法选项,但不可能返回 schema 之外的值——0% 类型错误是数学声明而非能力声明。批评者(The Register 等)也指出”不生成自然语言的结构性不可能幻觉”属于营销修辞〔社区〕24。
confidence与probabilities分离:confidence 是由分布形状导出的单一统计量(官方三选项演示近似(3×最大概率−1)/2,分布越平越不确定),完整分布同时返回供自定义阈值〔官方〕25。- 官方推荐的置信度路由模式:低风险操作过了底线即执行、置信 <0.5 转人工或升级模型、高风险操作(如批准转账)要求 >0.9——阈值随风险缩放〔官方〕25。这直接对应后文 Agent 基建里”System 1 判断 + System 2 兜底”的分层。
2.4 训练算法:RLCD(Reinforcement Learning for Calibrated Decisions)
官方 ML primer 将 RLCD 定位为与 RLHF/RLVR 并列的第三条后训练路线〔官方〕26:
| 路线 | 奖励信号 | 已知副作用(官方说法) |
|---|---|---|
| RLHF(InstructGPT 路线)6 | 人类偏好 | 谄媚、mode dropping、奖励幻觉 |
| RLVR | 可验证正确性 | jagged intelligence |
| RLCD | 概率与真实结果频率的匹配(声称标 0.9 时长期约 90% 为真) | — |
算法细节(奖励的数学形式、RL 算法、基础模型来源)全部未公开,论文未发表2315。创始人在 HN 与播客中反复强调的护城河判断是:”data is probably far most interesting than architecture“(瓶颈在校准训练数据而非架构)1523。
开源侧的呼应证据:Laya 用严格适当评分规则(proper scoring rules,重罚自信的错误)加 GRPO 式策略梯度训练,出厂原始分数严重过自信(ECE 0.466),held-out 温度缩放后才降到 0.081——佐证”校准是训练/后处理层面的苦活,不是架构魔法”16。预训练语料仅知”全合成数据”;是否从 LLM 蒸馏无披露(旁证:官方开源的 system-one-adapter-python 正是用 GPT-6 Astra / Fable 5.1 的结构化输出模拟 System One 契约来产生参考概率——说明”LLM 当决策标注器”是该公司认可的数据生成范式27,但不能证明 Jev 训练用了蒸馏)。面向用户不提供微调或 LoRA,定制只能靠 state、instructions、criteria 的措辞〔官方〕7。
2.5 与 GPT 类自回归 LLM 的区别
| 维度 | 自回归 LLM(GPT 类) | Jev |
|---|---|---|
| 输出 | token 序列,逐个解码 | 预定义选项集上的概率分布,无 token 生成 |
| 目标函数 | next-token prediction + RLHF | RLCD(校准决策) |
| 推理复杂度 | 输出 N token = N 步解码 | 单次前向,多问题并行,加问题几乎不增时延 |
| 延迟/成本 | 推理任务秒到百秒级;输出约为输入价 5 倍 | 70–500ms;$0.042/MTok 输入、输出免费 |
| schema 合规 | 靠约束解码/JSON mode,仍可能违规 | 构造性保证(类型错误恒为 0) |
| few-shot ICL | 支持 | 不支持:state 被当数据而非指令,官方明确建议别在 state 里塞指令或示例28 |
| 典型失败 | 编造事实、破坏 JSON | 字面化阅读、不会算术/计数/日期比较、可被注入28 |
独立对照数据(注意口径差异,见第 2.8 节勘误):Banking77(77 类银行意图)独立基准(n=500)上,微调 BERT 88.0% > claude-sonnet-5 77.4% > Jev 76.4% > gpt-5-mini 73.6% > Laya 38.2%29;另一组广泛转述的数字(Jev 79.0%/81.1% vs OpenAI 两模型 83.9%/86.2%)未能定位精确出处,方向一致但数值请以前者为准。TDS 作者的本地对照:Jev 81.1% vs Qwen3-Coder-Next-80B 76.4%(Qwen 有 1.72% 输出非法标签、Jev 为 0),中位延迟 245ms vs 249ms(vLLM 加 prefix caching)3014。Every.to 的编辑检查实测:Jev 中位 0.35s vs Fable 5.1 的 8.83s(约 25 倍快、约 580 倍便宜),代价是缺陷检出 6/7 vs 7/731。模式很清晰:快 1–2 个数量级、便宜 1–3 个数量级、纯准确率互有胜负。
2.6 与 BERT 类 encoder 的区别
结构家族上 Jev 最接近 BERT(双向 encoder 加打分头),差异在四个实质点:
- 输出空间绑定时机:BERT 分类头的标签集在微调时固化([CLS] 加单分类层32),换标签集要重训;Jev 的输出空间是每次请求的参数,选项语义用自然语言即时定义——本质是把 FLAN/T0 式的”指令化零样本分类”3334与 NLI 式零样本分类35从”prompt 技巧”升格为产品契约。
- 校准是一等公民:BERT logits 出名地过自信(Guo et al. 2017 的 ECE 与 temperature scaling 经典结论36);Jev 把校准做成训练目标(RLCD)。但独立审计泼了冷水,见 2.8。
- 多问题并行加类型系统:一次调用混合任意 Choice/Score/Noul,各带自然语言条件;BERT 一头一任务。
- 语义敏感性:官方自己承认 Choice(相对判断)与 Noul(绝对判断)对同一命题可给出不一致数值28;学术审计进一步发现决策头跟随选项名的语义极性而非绑定其上的 rubric(详见 2.8)22。
2.7 与传统分类器的区别
对照 sklearn 逻辑回归/微调分类器这类单任务判别模型,差异是工程形态而非数学范式:
- 类别空间运行时可变(传统分类器类别绑定在权重里);返回完整分布加校准置信而非只有 argmax;一次调用多任务而非一模型一任务;自然语言定义的判别标准(criteria 文本)而非训练集隐式边界。
- 但闭集强迫问题与传统分类器完全一样:PriorBench 测试中 30 条不属于任何类别的输入(schema 无 other 选项)仍全部获得 ≥0.99 置信的强行归类〔独立,TDS 实测〕30——必须在 schema 里显式设计
other/none of the above出口。 - 社区最尖锐的批评正落在这里(见第五节):带校准概率的快速 typed 分类器已存在几十年,Jev 的实质创新是接口、产品化与校准数据,而非发明新范式3724。
2.8 学术审计的三个冷静发现
发布两周内已出现一批 2026-09 的 arXiv 论文做独立审计,三个结论值得作为选型基准:
- typed readout 无独立准确率优势:TDM 综述审计的结论是”typed readout 本身相较可比的标签概率读出(BERT+softmax、LLM logprobs)尚未显示出独立的准确率优势;Jev 最明确的收益在延迟与成本”38。
- 概率不满足公理:P(X) 加 P(¬X) 平均偏离和一 0.064,三个单标签概率平均和可达 1.1439;官方 jaggedness 页也自认 Noul 与 Choice 数值可不一致28。
- 校准有已知裂缝:自报 ≥0.9 置信时实际准确率仅约 72.2%(jevcheck/jev-reliability 评测,经 jev-radar 记录)40;TDS 实测 0.7–0.9 中间置信段报告均值 0.81 而实际正确率 53%30;选项名敏感性——把选项
0/1改名no/yes导致每百题约 70 次答案翻转(AUC .94→.23),托管版 Jev 同样中招(AUC .8146→.5806,翻转幅度是底噪的 24 倍),而类型错误率全程 0%——“类型安全 ≠ 决策正确”22。
三、应用篇
3.1 语义检索:占 reranker 位,做不了双塔
Jev 不输出向量、无法建 ANN 索引,因此不能做双塔召回;它占的是 cross-encoder/reranker 的位置,且所有已知实践都是”BM25/向量先召回,Jev 重排/过滤”的两段式〔社区共识,无反例〕1040。
- 官方 cookbook〔官方数字,经 Firecrawl 转述;官方 cookbook 页当前 404〕10:法律检索集上 BM25 短名单加每个查询-候选对一个 Noul(”此文档是否直接回答该查询”),top-1 从 5%→18%、top-10 从 38%→62%,1200 次打分共 $0.0645。
- 生产级信号:金融科技公司 Ramp 的联创在 X 上称工程师将 Jev 与 GPT-5.6 Luna 做 LLM 重排器替代基准测试,准确率持平、尾延迟降约 10 倍〔公司方声明,未见完整技术报告〕41;笔记应用 keep.md 称重排比原方案(GLM 4.7 Flash)快 7 倍、打标快 50 倍〔项目方数据〕40。
- 对 embedding 模型的互补性:embedding 无法理解指令。官方 RAG cookbook 的经典演示:80 段文档加 1 段注入攻击帖,余弦相似度把注入帖排第一(0.584),Jev 用 4 个 Noul 给出 0.99 注入概率并剔除10。
- 诚实的负结果:芬兰语基准中 MuPLeR-fi 方案 top-1 从 73%→96.5%,但代码搜索场景认负(42% vs 专用索引方案 74%)40。
- 与专用 reranker 的量化对比目前缺失:Jev vs Cohere Rerank / bge-reranker 的公开对照表未找到;定性上 reranker 更便宜且可本地部署,Jev 的差异化在”自由格式 rubric”——可问”该段落是否与查询前提矛盾”而非只有”是否相关”1014。
3.2 Agent 基础设施:落地最深、最实的方向
(a)模型路由。jev-codex-router 回放 7 天 237 个真实 turn 省约 60% 成本(单次路由 $0.00003 / 0.6s);claude-router 一天内 86.5% 请求被路由到低价模型、总花费降约 15%〔社区,jev-radar 记录;注意 Janus 基准发现路由阈值不可跨数据集迁移〕40。平台级:Vercel AI SDK 7 的 experimental evaluate API(模型 ID typesafe-ai/jev)42、OpenRouter jev-1.139、LiteLLM v1.103 passthrough。
(b)工具路由。jev-palette 用一次 Choice 同时问 77 个命令(约 100ms / $0.00004);browser-use 官方实验项目 jev-ultrafast(Jev 选动作、LLM 只在需要生成文本时调用);JevLoop(Choice 选工具 + Score 评风险 + Noul 判授权,高风险强制人工审批)。WebMCP 基准上 Jev 组合方案 49/49 完成网页任务、成本比 GPT-6 Astra computer use 低约 112 倍,但裸 Jev 仅 25/49——适合做”选动作”,不适合端到端执行40。
(c)动态思考深度(决定是否调用 System-2 / 推理模型)——社区最活跃的玩法:suenot/codex-jev-router 为 Codex 子代理同时选模型与 reasoning effort43;WXK-AI/jev-opus 在 Claude Code 里为每次 API 调用选推理力度44;spending-effort-with-jev(Claude Code 插件,仅 ≥0.7 置信时提示 effort 档位,三方评分测试 95% 提示指向正确档位)45。
(d)Guardrails / 安全门控——数据最扎实的子方向。pi-warden(Pi 编码代理守护扩展:bash/write/edit 前问 4 个类型化问题,约 250ms/次;其 README 经历了一次口径修正:从 Firecrawl 09-23 快照的”17,000+ 调用 hold 42 次、约 88% 正确”更新为”hold 阈值提高到 ≥0.9、18,075 次重放 hold 率 0.1%,置信 <0.8 时错误率约 15%、>0.8 低于 1%”——两组数字都真实但版本不同)4610。buberlo/dsh-jev(DeepSeek Harness 决策层,MIT):fail-closed、单调决策组合(deny > hold > ask > allow)、只收窄不放宽;审计日志删除测试中无 Jev 时弱模型 4/10 得逞、有 Jev 时 31 次拒绝零执行;代价是每 turn 增加约 4.6s;其 README 的诚实脚注很值得引用:”提示词内规则同样有效且更便宜,Jev 的差异化价值在于模型上下文之外的可审计评估”47。jev-auto-approve 对只读命令 Noul ≥0.95 自动批准,8 个改状态命令 0 个被误批40。
(e)框架集成实况:Vercel(官方)/ OpenRouter(官方)/ LiteLLM(官方)/ LangChain(langchain-typesafe,含 ModelRouterMiddleware)/ LlamaIndex(创始人 Jerry Liu 的 docjev,40/40 文档分类、p50 约 182ms)/ AutoGPT(一等决策块)均有集成;OpenAI SDK 无官方集成;数据库侧出现 pg-jev、sqlite-jev、duckdb-jev 等扩展1140。两处社区以讹传讹需要澄清:Cloudflare——typesafe/jev 出现在 Cloudflare 的统一 AI 模型目录(第三方提供商路由),但不在 Workers AI 自托管 @cf/ 目录中(65 个自托管模型逐一核对无匹配);Firecrawl 与 Kai Waehner 提到的 Databricks、Camunda 接入(含”SemIf-OpenJev”演示)未能在两家官方文档中核实,且 SemIf 仓库 README 零次提及 Databricks——按”未能确认、疑为讹传”处理101418。
3.3 具身智能:低频决策可用,高频闭环无证据
- 官方发布时的四类 demo 全部在模拟器:Minecraft 机器人(2 分钟会话约 15 万 token、约 1 美分)、自动驾驶模拟器(选加速/刹车/变道)、类 Subway Surfers 游戏、模拟无人机(15 分钟约 10 美分)——卖点是用现成模型加动作白名单,15 分钟到 1 小时搭好,无需微调〔官方宣称,MindStudio 报道〕48。
- 真实机械臂〔已证实,开源可复现〕:robo-harness(SO-101 机械臂,Jev 在预算约束下从带类型候选动作中选受限关节步)49;jev_robot(AgileX PiPER,本地 decider-2b 选技能)50。
- MuJoCo 仿真:OmniJev 每集仅 13 次决策 / 39 个输出 token 完成任务,决策延迟降低 6.8–13.6 倍、总 token 减少 51–86%;jev-drone 纯摄像头无人机 2.5 Hz 控制回路——这是全生态唯一的控制频率数字,距离高频控制(数百 Hz)差两个数量级51。
- 学术侧:Jev-Mobile(arXiv:2609.30186)与 System One 控制的 agent 记忆筛选(arXiv:2609.34227)已出现;Jev-as-judge 用于 5,219 条 agent 轨迹审查,中位单次 0.99s、每条有效判断约 $0.00019552。
- 明确不存在的:大于 10 Hz 闭环高频感知决策的公开案例。正确的架构位是”System 1 做低频离散决策(技能选择/安全门控),System 2 或控制器做高频闭环”——与 HN 讨论中”Jev 当快神经系统、LLM 当慢推理器”的共识一致15。
3.4 自动驾驶:无真实案例,且延迟预算不支持
只有模拟器 demo(官方演示、jev-pilot-reflex、JEV-Drive 等,项目作者全部自我声明不可用于真实车辆)。未发现任何车企或自动驾驶公司的合作、试点或公开测试。结构性原因也清楚:V2X 协同感知综述给出的端到端延迟预算约 100ms53,DAIR-V2X 实证显示 0→500ms 延迟下感知性能显著退化——Jev 70–500ms 的云 API 延迟落在预算边缘至超标区间;若未来出现本地化的 Jev-like 小模型(如 Laya 的 33ms 级别),才可能进入车端感知决策栈。
四、开源生态地图(截至 2026-09-29)
4.1 开源替代:两周内的”复刻军备竞赛”
| 项目 | 定位 | 关键事实 |
|---|---|---|
| Laya(约 28k star,Apache-2.0) | 最大开源 System One 替代 | ModernBERT-large 421M / mmBERT 322M;兼容 /v1/systemone 协议(改 baseUrl 即可迁移);约 33ms/题;零样本基础检查点接近随机(0.36 vs 随机 0.32),价值在微调;大选项集上被 Jev 明显拉开(Banking77 0.425 vs 0.870);温度缩放后 ECE 0.081 vs 0.246;MLX/CoreML/llama.cpp 全平台移植1617 |
| SemIf / 原 OpenJev(约 4.5k star) | 接口复现 | Qwen3.5-4B logits 直读;21 条二分类准则 1.02s vs 自回归生成 JSON 5.33s;与 Jev 模态一致率 0.845(4B)/0.958(27B 桥接)vs Jev 官方 0.8831810 |
| openjev(509 star) | 另一个同名复现(注意与上者区分) | 主模型 DiffusionGemma 26B-A4B;内置 jevk5-0.2 = Qwen3.5-4B + LoRA(蒸馏自 Qwen3.6-27B),对选项字母 A–P 的 next-token logits 做 softmax 读出54 |
| Kev(约 7.7k star) | Qwen3.5/3.8 底座 LoRA 家族 | 0.8B/4B/9B/27B 四档,附温度校准;官方 Python SDK 可直连 TypeSafe 契约55 |
| Jeff(firelex/jeff,0.8B;logan-markewich/jeff 基于 GLiFormer) | “家里训出的 Jev 兼容模型” | 约 30ms;后者用 GLiFormer 做 drop-in 替代19 |
| GLiFormer / GLiNER | 先例论证的支柱 | GLiFormer 仓库建于 09-11(早 Jev 四天);真正的先例是 GLiNER(2023,标签即时定义的零样本 NER/分类 encoder)1920 |
4.2 周边工具与目录
- awesome-jev(1.9k star,另有 17+ 同名列表):17 大类——分类/路由 49 项、验证/护栏 44 项、评分排序 37 项、Agent 决策 56 项、Infra/SDK 92 项等11;
- jev-radar:220+ 案例追踪,带信任分级(A/B/χ)与上线状态标注(✅已上线/🔨原型/💭想法),案例事实核查的最好起点40;
- pi-warden / dsh-jev:编码代理护栏与 Harness 决策层4647;
- system-one-adapter-python:TypeSafe 官方开源,让任意 LLM 模拟 System One 契约27;
- 数据库扩展(pg-jev、sqlite-jev、duckdb-jev)、多语言 SDK(Swift/Rust/Go/PHP/.NET/Kotlin/Elixir…)、Julia 客户端 JevClient.jl——发布两周即全覆盖,蔓延速度罕见11。
4.3 生态位分析
第三方四轴榜单(fstandhartinger/jevbench:智能/校准/速度/成本等权调和,95 个系统)给出的排位是重要信号:Jev 1.13.0 仅列第 4(63.29 分),排在开源的 Imajev-4B(67.37)、Plumb-4B(65.84)、decider-4b(64.13)之后56。这与”开源两周内填平可替换性护城河”的判断互相印证:Jev 的残余优势集中在大于 20 选项的大选项集(Banking77 0.870 vs Laya 0.425)与托管服务的开箱即用,而这两条都不宽。
五、争议:营销还是范式
5.1 五路批评
- “重新发明分类模型”论:r/LocalLLaMA 高热帖《Jev isn’t new tech. It’s marketing targets people who think AI started with LLMs》的核心论点——”说读 logits 是新架构尤其蠢,LLM 之前分类的标准做法就是读 logits”;带校准概率的快速 typed 分类器已存在几十年(GBDT、约束解码 transformer),营销针对的是”以为 AI 史从 LLM 开始”的一代人3724。
- 25 行代码复现论(技术含量最高的质疑):《Jev in 25 Lines of Python》(HN 690 分)用 llama-cpp-python 加载 Qwen3-0.6B,对各选项首 token logits 做 log-softmax 即得分布(示例 Phishing 0.885)——无需 RLCD、合成数据与 API。文中也诚实承认:跳过了校准57。
- 零样本分类先例论:BART 式零样本分类多年前已有;社区还翻出一年前就开源的”数据集+论文+仓库”完整实现(配套 Reddit 帖 3,246 赞,比任何 Jev 帖都高)37。
- 数字话术:官网 “193.6x faster / 444.6x cheaper” 来自自建 workflow evals——参考答案是 GPT-6 Astra 与 Fable 5.1 的平均,官方自认该参考偏向 OpenAI/Anthropic、且数字处于”真实收益偏高端”;HN 标题从 “Jev: New frontier model 40-400x cheaper” 一小时内被改名;独立基准显示相对 DeepSeek V4.1 Flash 只便宜约 2.6 倍——”便宜百倍”取决于和谁比1524。
- “零幻觉”话术:不生成自然语言的结构性不可能幻觉,属修辞;HN 高赞评论指出”不能输出非法类型 ≠ 不出错值”,CEO 本人承认 “confidently wrong 可能”15。
5.2 官方回应与定性
创始人(HN 用户名 CompleteSkeptic)的回应:架构保密 “close to the chest”、愿写论文;反复强调瓶颈是校准训练数据而非架构;批评纯 logit 掩码不足以获得校准1523。而 SemIf 的 0.845 vs 0.883 恰好量化了这条护城河的当前宽度:不算宽,但存在,且随数据积累可能拉大。
社区最持平的总结(ai-stat.ru 综述):“good model with bad origin story”——问题真实(便宜快速的 typed 决策),Jev 解决得好,但架构可复现、开源替代已至门下;这场争论本质是”类别命名权之争,而非困惑度之争”24。
六、批判性总结与选型建议
- 原理定位:Jev ≈ “把输出空间从 token 序列换成调用时声明的选项分布 + 以校准为训练目标 + 产品化的类型契约”。非自回归思想本身是 2018 年就成熟的方向58;真正的增量在接口设计(Choice/Score/Noul 三原语加全分布加 confidence 的契约)与校准数据工程,不在网络结构。
- 选型建议:把它当”快 1–2 个数量级、便宜 1–3 个数量级、校准较好但有已知缺陷的零样本结构化判断 API”,不要当更聪明的模型;纯准确率它通常打不过同任务微调模型(微调 BERT 88.0% vs Jev 76.4%)29,与中档 LLM 大致同档。
- 工程红线(独立审计反复复现的):schema 设计本身成为系统正确性的一部分(选项命名、
other出口、rubric 措辞——选项名翻转可致 AUC 从 .94 跌到 .2322);置信阈值必须按业务重校准(≥0.9 自报置信仅对应约 72% 实际准确率40);安全场景必须 fail-closed(dsh-jev 模式47)。 - 四条应用战线判定:Agent 基建(路由/思考深度/护栏)✅ 落地最深;语义检索 ✅ 但仅限 rerank/过滤位,做不了双塔召回;具身智能 ⚠️ 低频离散决策可用(含真实机械臂开源项目),高频闭环无证据;自动驾驶 ❌ 仅模拟 demo,云 API 延迟超出车端预算一个数量级。
- 值得跟踪的变量:JevBench 独立复测、Laya/Kev 校准差距是否收敛、TypeSafe 是否开放微调、以及 arXiv:2609.32160 综述作者承诺的”typed readout 是否存在独立准确率优势”的后续验证38。
七、研究方法、勘误与局限
方法:本文由七个并行研究通道汇集——TypeSafe 官方文档与发布博客逐页抓取(docs.typesafe.ai 全站索引 111 页)、三组独立检索代理分头调研(原理/应用/开源生态与舆情)、主线程对 Firecrawl 与 Kai Waehner 两篇核心长文的精读,最后做交叉比对与矛盾仲裁。
已知勘误与口径冲突(引用前请注意):
- Banking77 数字存在两套口径:本文以可验证的 dhruvmehra/jevbench(n=500)为准29;广泛转述的”79.0%/83.9%/86.2%”未能定位精确出处。
- “openjev” 实为两个不同项目:TheoLeeCJ/SemIf-OpenJev 与 razorback16/openjev,本文已分别标注1854。
- Cloudflare 集成形态:统一 AI 模型目录(第三方路由)有
typesafe/jev,Workers AI 自托管 @cf/ 目录(65 个模型)无匹配——多个教程混称”Workers AI 上的模型”。 - Databricks/Camunda 接入、”SemIf-OpenJev 用于 Databricks 演示”:两家官方文档未核实、SemIf 仓库亦零提及,疑为讹传。
- Vercel “18x safety classifiers” 的最接近可靠出处是 TechCrunch 报道4,Vercel 官方博客只背书”最快被采用”。
- Reddit 原帖正文被反爬墙拦截,质疑论点靠多源快照交叉;X 帖未能直接抓取。
- 开源项目 star 数为 2026-09-29 当日快照,变化极快。
参考文献
-
TypeSafe AI. “Introducing System One Models and Jev.” 2026-09-15. https://typesafe.ai/blog/introducing-system-one-models-and-jev ↩ ↩2 ↩3 ↩4 ↩5
-
Daniel Kahneman. Thinking, Fast and Slow. Farrar, Straus and Giroux, 2011.(System 1 / System 2 双系统理论的原始出处) ↩
-
Wikipedia. “Jev (AI model).” https://en.wikipedia.org/wiki/Jev_(AI_model) ↩ ↩2 ↩3 ↩4
-
TechCrunch. “A new kind of AI model from a ChatGPT inventor is thrilling developers.” 2026-09-18. https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Ouyang et al. “Training language models to follow instructions with human feedback.” arXiv:2203.02155. https://arxiv.org/abs/2203.02155 ↩ ↩2
-
TypeSafe AI Documentation — Models. https://docs.typesafe.ai/models ↩ ↩2 ↩3 ↩4
-
Vercel Blog. “Jev on AI Gateway — the fastest-adopted model in AI Gateway history.” 2026-09. https://vercel.com/blog/ai-gateway-jev-model-launch ↩ ↩2
-
OpenRouter — typesafe/jev-1.13. https://openrouter.ai/typesafe/jev-1.13 ↩ ↩2
-
Firecrawl (Hiba Fathima). “What Is Jev? Inside TypeSafe’s Decision-Only AI Model and Its Developer Use Cases.” 2026-09-23. https://www.firecrawl.dev/blog/what-is-jev ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8
-
yibie/awesome-jev(GitHub,17 大类生态目录). https://github.com/yibie/awesome-jev ↩ ↩2 ↩3 ↩4
-
TypeSafe AI Documentation — Quickstart. https://docs.typesafe.ai/introduction/quickstart ↩ ↩2
-
TypeSafe AI Documentation — Choice / Score / Noul Primitives. https://docs.typesafe.ai/primitives/choice ↩ ↩2 ↩3
-
Kai Waehner. “How System One Models Like Jev Change Enterprise AI Architecture.” 2026-09-28. https://www.kai-waehner.de/blog/2026/09/28/how-system-one-models-like-jev-change-enterprise-ai-architecture/ ↩ ↩2 ↩3 ↩4
-
Hacker News. “Introducing System One Models and Jev”(1986 分 / 520 评论,创始人以用户名 CompleteSkeptic 答复). https://news.ycombinator.com/item?id=49717558 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
NandhaKishorM/laya(GitHub,含第三方对比基准与校准说明). https://github.com/NandhaKishorM/laya ↩ ↩2 ↩3
-
Towards AI. “Laya: A Free, Local Stand-In for TypeSafe’s Jev — If You Use It for the Right Job.” 2026-09. https://pub.towardsai.net/laya-a-free-local-stand-in-for-typesafes-jev-if-you-use-it-for-the-right-job-11aa0903f011 ↩ ↩2
-
TheoLeeCJ/SemIf-OpenJev(GitHub,前身 OpenJev). https://github.com/TheoLeeCJ/SemIf-OpenJev ↩ ↩2 ↩3 ↩4
-
Knowledgator/GLiFormer(GitHub,建于 2026-09-11)与 gliformer-large-v1(HuggingFace,DeBERTa-v3-large,575.6M). https://github.com/Knowledgator/GLiFormer 与 https://huggingface.co/knowledgator/gliformer-large-v1 ↩ ↩2 ↩3
-
Zaratiana et al. “GLiNER: Generalist Model for Named Entity Recognition using Bidirectional Encoder.” arXiv:2311.08526. https://arxiv.org/abs/2311.08526 ↩ ↩2
-
flock-io. “this-that-model-1.0 技术报告”(2B 开源复现). arXiv:2609.23886. https://arxiv.org/abs/2609.23886 ↩
-
“选项名翻转研究:Jev 及开放复现的决策头跟随选项名而非 rubric.” arXiv:2609.26758. https://arxiv.org/abs/2609.26758 ↩ ↩2 ↩3 ↩4
-
Latent Space. “Jev: Diogo Almeida 访谈(播客逐字稿).” 2026-09. https://www.latent.space/p/jev ↩ ↩2 ↩3 ↩4
-
ai-stat.ru. “Jev / System One 舆情综述:good model with bad origin story.” 2026-09-25. https://www.ai-stat.ru/news/2026-09-25-jev-system-one-backlash ↩ ↩2 ↩3 ↩4 ↩5
-
TypeSafe AI Documentation — Confidence. https://docs.typesafe.ai/confidence ↩ ↩2
-
TypeSafe AI Documentation — Machine Learning Primer(RLCD 与 RLHF/RLVR 的官方对照). https://docs.typesafe.ai/introduction/machine-learning-primer ↩
-
typesafe-ai/system-one-adapter-python(GitHub,TypeSafe 官方开源 LLM 适配器). https://github.com/typesafe-ai/system-one-adapter-python ↩ ↩2
-
TypeSafe AI Documentation — Model Jaggedness (jev-1.13)(官方自认的九类失败模式). https://docs.typesafe.ai/model-jaggedness/jev-1.13 ↩ ↩2 ↩3 ↩4
-
dhruvmehra/jevbench(GitHub,Banking77 n=500 独立基准). 2026-09-22. https://github.com/dhruvmehra/jevbench ↩ ↩2 ↩3
-
Towards Data Science. “Jev vs. LLMs: When AI Moves from Generation to Decision-Making.”(日本作者实测,含 Banking77、校准区间与级联实验). https://towardsdatascience.com/jev-vs-llms-when-ai-moves-from-generation-to-decision-making/ ↩ ↩2 ↩3
-
Every.to. “Mini-Vibe Check: TypeSafe’s Jev Judged Everything I’ve Written in 0.7 Seconds”(Mike Taylor 与 Dan Shipper 独立实测). 2026-09. https://every.to/vibe-check/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds ↩
-
Devlin et al. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” arXiv:1810.04805. https://arxiv.org/abs/1810.04805 ↩
-
Wei et al. “Finetuned Language Models Are Zero-Shot Learners”(FLAN). arXiv:2109.01652. https://arxiv.org/abs/2109.01652 ↩
-
Sanh et al. “Multitask Prompted Training Enables Zero-Shot Task Generalization”(T0). arXiv:2110.08207. https://arxiv.org/abs/2110.08207 ↩
-
Yin, Hay, Roth. “Benchmarking Zero-shot Text Classification”(NLI 式零样本分类). EMNLP 2019. arXiv:1909.00161. https://arxiv.org/abs/1909.00161 ↩
-
Guo et al. “On Calibration of Modern Neural Networks.” ICML 2017. arXiv:1706.04599. https://arxiv.org/abs/1706.04599 ↩
-
r/LocalLLaMA. “Jev isn’t new tech. It’s marketing targets people who think AI started with LLMs.” 2026-09. https://www.reddit.com/r/LocalLLaMA/comments/1woe70t/jev_isnt_new_tech_its_marketing_targets_people/ ↩ ↩2 ↩3
-
“Typed Decision Models 综述审计:typed readout 的收益边界.” arXiv:2609.32160. https://arxiv.org/abs/2609.32160 ↩ ↩2
-
“Jev 类模型概率公理检验.” arXiv:2609.33209. https://arxiv.org/abs/2609.33209 ↩
-
everyinfra/jev-radar(GitHub,CASEBOOK:220+ 案例追踪与信任分级). https://github.com/everyinfra/jev-radar ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10
-
Veeral Patel (Ramp 联创) 于 X 发布的基准测试声明. 2026-09-24. https://x.com/vral/status/2103207156593942783 ↩
-
Vercel Documentation — AI Gateway Evaluation(experimental evaluate,模型 ID typesafe-ai/jev). https://vercel.com/docs/ai-gateway/modalities/evaluation ↩
-
suenot/codex-jev-router(GitHub). https://github.com/suenot/codex-jev-router ↩
-
WXK-AI/jev-opus(GitHub). https://github.com/WXK-AI/jev-opus ↩
-
Yaxin9Luo/spending-effort-with-jev(GitHub,Claude Code 插件). https://github.com/Yaxin9Luo/spending-effort-with-jev ↩
-
DevMortimer/pi-warden(GitHub). https://github.com/DevMortimer/pi-warden ↩ ↩2
-
buberlo/dsh-jev(GitHub,DeepSeek Harness 决策层). https://github.com/buberlo/dsh-jev ↩ ↩2 ↩3
-
MindStudio. “Typesafe AI’s Non-Autoregressive System-1 Model.” 2026-09. https://www.mindstudio.ai/blog/jev-system-one-model-launch ↩
-
grmkris/robo-harness(GitHub,SO-101 真实机械臂). https://github.com/grmkris/robo-harness ↩
-
Hu-xiao-max/jev_robot(GitHub,AgileX PiPER 真实机械臂). https://github.com/Hu-xiao-max/jev_robot ↩
-
RomanSlack/jev-drone(GitHub,MuJoCo 无人机,2.5 Hz 控制回路). https://github.com/RomanSlack/jev-drone ↩
-
“JEV-as-judge:5,219 条 agent 轨迹审查实测.” arXiv:2609.34862. https://arxiv.org/abs/2609.34862 ↩
-
V2X 协同感知综述(端到端延迟预算约 100ms). arXiv:2310.03525. https://arxiv.org/abs/2310.03525 ↩
-
razorback16/openjev(GitHub). https://github.com/razorback16/openjev ↩ ↩2
-
jaredpalmer/kev(GitHub,Qwen3.5 底座 LoRA 家族). https://github.com/jaredpalmer/kev ↩
-
fstandhartinger/jevbench(GitHub,四轴等权第三方榜单,95 系统). https://github.com/fstandhartinger/jevbench ↩
-
nobodywho. “Jev in 25 Lines of Python.”(HN 690 分). https://nobodywho.ai/posts/jev-in-25-lines/ ↩
-
Gu, Bradbury, Xiong, Li, Socher. “Non-Autoregressive Neural Machine Translation.” ICLR 2018. arXiv:1711.02281. https://arxiv.org/abs/1711.02281 ↩