TapeOut.linkarticles

能被流片的不是 AI,而是决策面:TapeOut × Jev 系列研究 ver 1

研究提案,非协议更新:值得固化的不是 AI 本体,而是收缩后的决策面——输入输出有限、状态明确、权限受限、默认拒绝。Jev 的 Choice / Score / Noul 只把模型输出收进窄接口,解决的是编码歧义而非世界真相;confid…

能被流片的不是 AI,而是决策面:TapeOut × Jev 系列研究 ver 1
研究提案;不表示 Jev 已被蒸馏、部署或映射为运行中的 Circuit。

AI 最不缺的是答案。

它缺的是一种不能讨价还价的边界:什么输入算有效,什么动作允许被提出,什么条件下必须停下,以及谁有权把一个判断变成现实里的后果。

这是一个不那么讨喜的判断。因为它把注意力从更大的模型、更长的上下文和更会说话的 Agent,拉回到软件工程里最古老的东西:接口、状态、权限与默认拒绝。

但恰恰在这里,智能系统才开始从“很会回答”走向“可以被约束”。

本系列研究的核心命题是:能够被制造成长期、可复核工件的,不是开放世界里的 AI 本体,而是经过严格收缩的决策面。 AI 可以继续观察、解释和提出方案;真正值得冻结的,是它之下那一小块输入有限、输出有限、状态明确、权限受限、允许被反例推翻的行为。

这不是把模型缩小一点,也不是把 JSON 改成二进制。它是一种更深的分工:把聪明留在可变层,把不可协商的边界放进确定层。

https://docs.typesafe.ai/model-jaggedness/jev-1.13

答案很多,边界稀缺

大模型擅长在模糊问题中继续展开。它可以替人总结、联想、解释,甚至为一次明显错误的判断补上一段极有同理心的论证。对写作而言,这通常是优点;对执行而言,恰好相反。

一旦一个判断接近外部动作,系统真正需要回答的问题会变得简单且冷酷:输入是否来自认可的来源?字段是否符合版本?当前状态是否允许?额度是否越界?请求是否已经过期或被重放?没有独立授权时,能否执行?

这些问题不需要一篇漂亮的回答。它们需要一个不接受辩解的 DENY。

所以,本文所说的决策面,不是模型的一次输出,也不是一份提示词。它是一个被完整写下的合同:有限的输入字段与编码、可见的状态、有限的动作集合、明确的默认分支、失败路径,以及动作所能触及的权限范围。

只要其中任何一项仍然依赖“模型大概会理解”,这个面就没有闭合。它仍是一段开放世界的叙事,而不是可检验的规则。

这也是为什么“给 Agent 更多工具”与“给 Agent 可验证的执行边界”是两件完全不同的事。前者增加能力,后者限制损害。真正稀缺的从来不是前者。


Jev 改变的是接口,不是认识论

Jev 的价值,恰好在于它把模型输出从自由文本收进了较窄的接口。按照 TypeSafe 的公开文档,Choice 在预定义选项中返回选择及完整概率分布;Score 对有序等级给出概率加权分值;Noul 返回“是”的概率。

这很重要,但重要的原因并不是“模型终于会说真话”。而是软件不必再从一段散文里猜测模型究竟想表达 ALLOW、REVIEW 还是 DENY。输出的形状预先可知,控制流可以直接消费它。

类型化输出解决的是编码歧义,不是世界真相。

这条边界必须说得足够清楚。一个类型合法的 ALLOW,仍可能来自错误的事实、被操纵的上下文或错误的推理。Jev 的公开说明本身列出了数字计算、日期比较、长且噪声很多的 state 等弱项,也明确提示 state 中的对抗性内容可能改变判断。

因此,不能把“不能吐出 schema 外字段”偷换成“不会做错决定”。前者是接口性质;后者是关于某个任务、某个分布和某套标签的经验命题。两者之间隔着数据、时间、语言、攻击方式和一整个现实世界。

这里还需要把三个经常被混为一谈的词拆开。

confidence 说的是模型输出分布有多尖锐。对于 Choice 与 Score,Jev 文档将它与返回概率分布关联;Noul 则只给出 P(yes),没有独立的 confidence 字段。 它可以提示“模型更像是在犹豫,还是更像在偏向某个选项”,但不构成许可。

calibration 说的是长期统计关系:一批被报告为 90% 的预测,是否在相应的、带真实标签的群体上大约有 90% 正确。它要求冻结的评估协议、独立标签与指定分布;现代神经网络并不会天然满足它,分布变化后也可能失效。

authorization 则根本不是概率概念。它是一个制度与安全概念:谁批准了什么动作,批准绑定到哪个 payload、何时失效、能否重放、执行器有没有旁路。一个输出可以很自信、也可以在历史样本上看似校准,却仍然没有资格动用任何不可逆权限。

把这三件事压成一句“高置信度就自动执行”,等于让一个统计分数越过了产品、治理和安全三道门。系统会显得很敏捷,直到它第一次很自信地犯错。

https://proceedings.neurips.cc/paper_files/paper/2022/hash/0d3496dd0cec77a999c98d35003203ca-Abstract-Conference.html

两条路线,两个完全不同的问题

Jev 与 TapeOut 可以连接,但只能沿着两条性质不同的路线连接。把它们都叫作“AI 上链”,既不准确,也会掩盖风险。

https://docs.typesafe.ai/confidence

第一条是在线提案路线。Jev 读取文本或结构化状态,只提出有限的动作建议与概率。随后,确定性安全层只读取规范化后的字段和独立事实,例如 schema 版本、来源完整性、额度、时效、状态位、nonce 与人工批准位;若该安全层最终按协议发布,它才成为大写的 Circuit 工件。它输出 DENY、DEFER 或受限的 ALLOW。最后,独立执行器再次核对动作、payload 哈希、权限范围、过期时间与一次性使用条件。

本文固定使用一组不混用的行动词:DEFER 是在线执行处置,表示把请求送往人工或更强审查;第二篇使用的 REVIEW 是离线三类输出 codebook 中的类别。一个 REVIEW 码在具体系统里通常会被执行层路由为 DEFER,但两者属于不同合同,且都不是 ALLOW。

这条路线的关键不是“Jev 被注入也没用”。那样说错了安全属性。更准确的说法是:即使 Jev 被误导,受操纵的提案也不应单独获得越权能力。 OWASP 对提示注入的建议同样强调最小权限、确定性格式校验和对高风险动作保留人工批准。

在线路线因此不是让 Circuit 替模型理解自然语言。Circuit 不该读一整段不可信文本,更不该替模型承担语义幻觉。它只应该守住那些可以独立检查的硬条件:未知版本不放行,来源失败不放行,额度超限不放行,重放请求不放行,高影响动作没有单独批准不放行。

在这里,Jev 的地位很朴素:它是提案者,不是主权者。概率只能令权限收紧,例如让系统进入 DEFER;它不应独自令权限放宽。

第二条是离线冻结路线。这条路不让 Jev 在运行时参与。研究者需要先冻结具体模型版本、问题与 criteria、输入序列化方式、查询时间窗、重试规则和概率聚合方式,并保留完整概率响应。然后,Jev 从运行时退出,留下的只是一张受限函数的参考表:固定长度输入与显式状态,映射到有限动作或定点概率编码。

此后尝试被物化的,不是 Jev 的权重,不是它的语言能力,更不是某个模型对世界的理解。它只是一个有边界的策略工件。如果有效输入域可以完整枚举,最严谨的办法往往是直接综合冻结表,并对整个域检查等价;没有必要先训练一个学习器去模仿已知函数。只有域过大、只能采样而又存在可压缩结构时,DiffLogic/LGN、决策树或其他学生模型才值得参加比较。

这个判断有一点反潮流:学习并不总是更高级。看得到完整真值表时,继续“让模型学习规则”,经常只是把本来可证明的问题变成一个多了拟合误差与离散化误差的问题。


TapeOut 的价值,不是把 AI 变成神谕

TapeOut 的潜在价值,正在于它为这类受限工件提供一种公共的制造面。公开资料表明,其 V1 以 NAND 和按 tick 更新的一位 LATCH 为基础元件,完成的 Circuit 可以作为工件被评估与复用。

对本命题而言,这比“链上能运行一个函数”更有意思。一个有限策略工件(bounded policy artifact)一旦被固定,就可以被问得很具体:它看到了哪些位?在什么状态下允许?非法码会怎样?谁能找到反例?能否在同一输入合同下做出成本更低、行为相同的实现?

这是一种罕见的可争论性。模型的自然语言解释往往可以随着提示词、上下文和版本改变;而一个有限决策工件至少可以把争论压缩成可复现的问题:给定这一编码输入,机器为何输出这一位?

但不要把这种可复核性夸大成自治。公开材料支持的是 NAND/LATCH、Circuit 工件和受限的评估接口;它不自动给出传统芯片制造所需的物理设计与 signoff,也不自动提供跨交易持久状态、签名、持续调度或不可绕过的资产控制。 LATCH 是状态元件,不是一套完整的状态系统;Circuit 给出输出,也不等于它获得了执行世界的权限。

这正是 TapeOut 在本叙事中的正确位置:它不是 AI 的终点,也不是一个会自己行动的经济主体。它是让已经被缩小、被说明、被限制的行为,拥有一个更容易被长期引用、审计和挑战的载体。

https://proceedings.mlr.press/v70/guo17a.html

最强的反对意见,其实是对的

这里最有力的反对意见是:把世界编码成 bits,并没有消灭模糊性,只是把模糊性藏到了电路外面。

这是正确的。

文本如何被解析?来源为何可信?缺失值为何被解释为 unknown 而不是零?时间窗口从哪一刻开始?状态由谁写回?某个“允许”究竟对应什么现实后果?这些问题若没有独立答案,那么再小、再确定的电路,也只是稳定地复制了前端的误解。

更糟的是,冻结本身可能成为风险。开放语言、频繁变化的业务含义、依赖人类裁量的争议、无法验证的外部事实,或需要长期权衡的新情境,都不适合被假装成一个永久的有限函数。在这些地方,硬化不是安全;它可能只是把过时判断铸成更难修正的形式。

所以,决策面一旦存在下列条件,就不应急于走离线冻结路线:输入语义无法审计;状态来源不可复放;动作后果无法授权或撤销;独立真值不存在;模型版本、schema、阈值或目标群体仍在移动。此时更合理的选择是保留在线提案,并把确定性逻辑用于限制,而不是用于伪装理解。

还有一个简单的失败条件:如果 policy 本来就是清楚的规则,例如版本检查、额度上限或 nonce 防重放,那么根本不需要 Jev。直接写规则、综合规则、验证规则,反而更诚实。用 AI 给已知 if/then 打标签,再训练另一个系统模仿它,并不会创造智能,只会增加误差来源。

https://tapeout.net/

事实、主张与待验证对象

已知事实是:Jev 的公开接口提供 Choice、Noul、Score 等有限类型决策原语;其文档也披露了能力边界。TapeOut 的公开 V1 资料说明 NAND、LATCH 与 Circuit 工件模型。形式验证可以证明一个固定实现是否符合固定参考,却不能证明参考本身描述了现实。

厂商与协议公开表述应只按其可证范围理解。它们可以说明接口形状、公开功能和产品定位;它们不能替代特定领域的正确率、安全性、校准或授权证据。

本文的研究提案是双层架构:在线时,Jev 只提出,Circuit 与执行器独立限权;离线时,只把冻结后、有限化的决策面作为候选研究对象。本文不宣称 Jev 已被蒸馏、部署或映射为任何 Circuit。

预注册设计则应在首次教师调用之前锁定输入合同、教师快照、概率编码、状态语义、基线、成功标准与停止条件。它应把教师保真、独立真值表现、硬化后行为、实现等价与执行权限分别报告。任何一层通过,都不能替另一层背书。

这份区分看似保守,实际是在为真正的结果留出重量。若一个实验最终只能证明“学生复制了一个冻结教师的有限编码输出”,那就应该这样写;若它还想谈现实正确性、校准或安全,就必须拿出独立于教师的证据。


结尾:让概率先失去讨价还价的权利

AI 会继续生成更多答案。模型会更快,工具会更多,Agent 会更擅长把目标拆成步骤。我们并不需要假装这条路会停止。

但系统越聪明,越需要知道哪些地方不能由聪明临场发挥。

真正值得被固定的,不是“模型认为世界是什么”,而是:当来源不明时停下;当状态不一致时停下;当权限不足时停下;当概率再漂亮也无法替代授权时停下。

这就是决策面的意义。它不是把 AI 变小,而是把 AI 放回一个可以承担责任的系统位置:可以提案,却不能随意改写边界。

如果这条路线最终有价值,TapeOut 所承载的也不会是一个被永久化的 AI。它会是一条有限规则的公共版本:可被读取、被复现、被挑战,也被允许在出现反例时失去资格。

下一步的问题因此不是“怎样把模型塞进机器”。而是更具体、也更困难的问题:当概率离开模型的叙述,进入有限编码、阈值、状态与默认拒绝之后,它究竟怎样才变成一台机器? #TapeOut #Jev

https://docs.typesafe.ai/api

References

[1] API Reference — TypeSafe AI Docs

[2] Confidence — TypeSafe AI Docs

[3] Jev 1.13 Jaggedness — TypeSafe AI Docs

[4] On Calibration of Modern Neural Networks — Guo et al., ICML 2017

[5] OWASP LLM01:2025 Prompt Injection

[6] Deep Differentiable Logic Gate Networks — NeurIPS 2022

[7] TapeOut Protocol — Public V1 Primitives and Circuit Interface

[8] Formal Verification — IEEE Tech Talk

[9] OpenLane Newcomer Guide and Signoff Flow

在 X 查看原文 更多文章