我给一个写着「封闭测试」的端点发了三次请求,拿到了三个不同的身份 token。没排队,没申请,没邮件。第四个 token 落地时,我正在用一个真实的 Shopify 商品,测试一个 AI 支付护栏产品会不会放行一笔 69.99 美元的错误购买。
一、十分钟跑通封闭测试
先说清楚我测的是什么。
delta.network,公司注册名 Repyh Labs,一个拿了 1100 万美元的加密团队。现在的产品叫 delta mandate,一句话:AI agent 替用户花钱之前,他们先验一道,买的东西对不对,值不值,是不是用户要的那个。
产品页面写着 managed SaaS,卖给平台客户。对外有个 live preview,叫「Bring your own agent」,页面明说是封闭测试阶段。安装方式很野,一行命令:
curl -fsSL -X POST https://delta-mandate-mcp.repyhlabs.dev/install | sh
我 curl 了一下这个脚本。它干的事就一件:调一次 install 接口,服务器当场 mint 一个新的 bearer token,然后把 token 塞进 Claude Code 的配置里。我又连着调了两次,每次都是全新 token,没有任何鉴权。
也就是说,封闭测试的「封闭」,靠的是没人来找。任何支持 streamable HTTP 的 MCP 客户端,拿到 token 就能进。我是用裸 curl 进去的,全程没碰 Claude Code。
进去之后是五个工具:读 policy 语言规范、搜商品类目树、提交 policy、提交 proposal、查判定结果。流程六步:用户定意图,agent 起草 policy,用户签名,agent 提交具体商品,delta 提取证据并验证,返回带 ZK 证明的通过或失败。
我把全流程跑完了。中间还顺手装了 Shopify 官方的 ucp CLI,用来在他们真实的商品目录里搜东西。整条链路,从写规则到拿到密码学判定,一个下午。
下面按顺序讲:这产品解决的问题是真是假,这家公司怎么走到这一步,实测发现了什么,以及我认为的裂缝在哪。
二、买错 27.3%,这个问题是真的
2026 年 6 月底,他们在 GitHub 上传了一个基准测试仓库,名字很长,叫 delta-Mandate-Shopify-Benchmarks。内容很扎实。
实验设计:100 条真实购买意图,从简单到变态分级。简单的比如「竹制砧板,30 美元以内」,难的比如「皮质笔记本封套,纯色,不要黑色,60 美元以内,带松紧带,皮革材质」,五个约束叠一起,商品可能根本不存在。
两组 agent 对比。对照组只用 Shopify 的 UCP CLI 搜商品然后下单,这是今天 agentic shopping 的标准姿势。实验组在同一套搜索前面加了 delta 的验证层,下单前先过 policy 引擎。
结果用一个混淆矩阵说话:
| 只用 Shopify 搜索 | 加 delta 验证 | |
|---|---|---|
| 正确买到 | 48 | 56 |
| 正确放弃(没有合规商品) | 23 | 44 |
| 买错(违反约束) | 18 | 0 |
| 错过(有合规商品却放弃) | 11 | 0 |
关键指标是购买错误率:agent 声称「找到了」的购买里,多少比例违反了用户约束。对照组 27.3%(18/66),加了验证层之后 0%。约束多的难题上,对照组错误率飙到 42.9%。
更有意思的是错误分析。18 次买错里,12 次是约束在商品数据里根本不存在,agent 直接宣称满足。5 次是 agent 靠直觉脑补,「不锈钢肯定可以进洗碗机」这种。只有 1 次是商品数据本身写错了。
这个错误模式我太熟了。LLM 最擅长的就是没有证据时编一个说得过去的答案。问题不在模型笨,在于没有任何机制逼它出示证据。
delta 把这个问题起了个名字,叫 mandate verification gap,指令验证缺口。现有支付工具能判断一笔交易「允不允许发生」,卡限额、商户白名单、审批门槛,都能做。但没有一个能判断这笔交易「是不是用户授权的那件事」。500 美元的卡限额挡不住 agent 花满 500 美元买错东西。
这个切分我认为是准的。限额管的是金额,验证管的是内容。内容这一层,现在是空的。
顺带说一句这个仓库的可信度。他们自己往 README 里写了大段自我打折的说明:发现和执行不是同等条件的对比,delta 那组有 5 条在并发压力下超时没出判定,所以「正确放弃 44」里有水分,干净的数字只有购买错误率那一行。拿自己的基准测试主动标注弱点,这个团队在诚实这件事上是有记录的。后面还会再验证一次。
三、Repyh:把 hyper 倒过来写
这家公司的转身次数,比大多数项目整个生命周期的事都多。
注册名 Repyh Labs,hyper 倒着拼。2024 年 10 月左右成立,团队偏北欧,挪威和拉脱维亚背景的工程师都有。2025 年 10 月,据 Blockworks 和 ChainCatcher 报道,他们以 1100 万美元的融资浮出水面,pre-seed 由 Figment Capital 和 Maven 11 领投,seed 轮由 Variant 和 DBA 领投。
注意这时候他们讲的故事。Blockworks 当时的报道标题是「一个挑战现有架构的新 Layer 1」。CPO Myles O’Neil 对媒体解释他们的架构:跟以太坊 rollup 不同,delta 网络里所有资产都留在基础层。2025 年年中的博客档案里,他们自称 permissionless network,做 sovereign execution domain,卖 Rust 写的 Executor SDK 和证明处理。
一个典型的加密基础设施工队。链、验证器、证明系统,全栈自研。
然后是第二次转身。2026 年 1 月,定位变成「The Integrity Layer」,完整性层,一个后端验证 API。permissionless 之类的词开始淡出。
第三次,2026 年 4 月,全面转向 agentic payments,产品定型为 mandate enforcement,也就是今天的样子。现在打开 delta.network,首页通篇是「指令执行」「支付释放前验证」,Layer 1 一个字都找不到了。链上周志(注:即本栏)持续在追踪这个 pivot,这是我第三次回头看他们,每次定位都不一样。
表面看是加密团队追 AI 热点,跟过去两年无数个「AI + crypto」换皮项目一个剧本。但仔细看技术构成,这次不太一样。
他们没有扔掉老本行。今天的 delta mandate 里,签名方案是 Ed25519、Passkey、多重签名三选一。policy 是内容寻址的,base58 编码的 SHA-256 哈希做 ID,我实测拿到的 policy ID 就是一串 base58。评估结果带 ZK 证明。这些全是那两年做执行层攒下的 primitives,一行没浪费,直接换了个买家:以前买单的是发币预期的加密投资人,现在是付美元的支付平台。
叙事换了,内核没换。可验证执行这件事他们做了两年,从「验证链上的执行」变成「验证 AI 的执行」,技术栈是同一套。
这类转型我见得多,多数是假转,白皮书改几个词,代码一行不动。这次是真转,判断依据后面讲。
四、实测:一个钱包的三种命运
回到我的测试。规则用他们提供的 DSL 写,长这样:
name black_leather_wallet_under_50
evidence {
category: string
color: string
clothing_accessory_material: string
price_cents: int
}
requires {
evidence.category == "Apparel & Accessories > Handbags, Wallets & Cases > Wallets & Money Clips > Wallets";
evidence.color == "Black";
evidence.clothing_accessory_material == "Leather";
evidence.price_cents <= 5000;
}
类目路径必须从他们的类目树里原样复制,不许自己编。品牌字段指南里明说提取不了。金额单位是美分,纯整数,没有浮点坑。提交后返回 policy ID,编译不过会给你行号和列号,跟正常编译器一个待遇。
然后我挑了三个真实商品,分别在 Shopify 目录里拿到商品变体的 GID,逐个提交。
| 商品 | 价格 | 颜色 | 材质 | 判定 |
|---|---|---|---|---|
| Radley 黑色真皮 bifold 钱包 | $38.40 | Black | Leather | ✓ 通过 |
| Bellicose 黑色 bifold 钱包 | $69.99 | Black | Leather | ✗ 拒绝 |
| Thread Wallets 竖款皮革钱包 | $24.99 | Black | Leather | ✓ 通过 |
第二个的拒绝返回里,失败原因精确到约束编号:
constraint[3] failed: evidence.price_cents <= 5000
同时返回它提取到的证据:价格 6999 美分。规则、证据、判定,三者对得上,你自己可以复算。从提交到出结果,2 到 5 秒。
我本来想测一个更刁钻的:商品标题写「Leather」但结构化属性里材质是别的,看看验证层会不会被营销文案骗。结果没测成,Shopify 目录的结构化数据太干净,标题和属性对不上号的商品我没找到。这本身就是一个发现,他们的 0% 错误率建立在 UCP 目录的属性是可信的这个前提上。这个前提在 Shopify 成立,出了 Shopify 未必。
顺带一提,他们另一个 demo 站叫 Son of Anton,名字来自美剧《硅谷》里那个乱买东西的失控 AI。给 AI 购物护栏起这个名字,策划的人有幽默感。
五、聪明的地方:ZK 管数学,保险管数据
现在讲这个产品真正打动我的设计。不是 ZK,是他们对信任问题的拆法。
他们的文档里有一页,直接写明白了自己证明不了什么。原话大意:证据提取是 LLM 跑的,非确定性,这一步不做密码学证明。policy 评估是确定性的,ZK 证明在这一步生成,绑定证据、意图、规则和结果,任何人可以独立验证评估算得对。
翻译成人话:ZK 只证明「判卷过程没作弊」,不证明「卷子上的答案是真的」。商品数据说钱包是黑的,提取层把它读成黑的,评估层判黑通过。如果商品数据本身撒谎,ZK 管不了。
多数项目会把这一页藏起来。他们不仅写了,还在这条裂缝上挂了一个商业产品:Mandate Guarantee,指令保证。一个金融担保,赔两种情况:提取错了(商品是白的,读成了黑的),或者评估错了(证据明明不满足,引擎判了通过)。只要错在「证据到判定」这一段,delta 赔钱。不赔的也写清楚了:数据全对、判定正确、商家发货发错了,那是普通商家纠纷,不归他们。
这个拆法是 Stripe 式的。数学能保证的部分用密码学,数学保证不了的部分用保险。用户不关心你用什么技术,用户关心出事了谁掏钱。ZK proof 是给工程师看的,赔付承诺是给采购和法务看的。
配套的还有 execution receipt,执行回执。每次评估生成一个签名对象,里面是授权的指令、agent 的提议、提取的证据、判定结果、适用的规则,据文档说背后挂着 ZK 证明。这是给事后扯皮用的:平台、发卡行、用户、争议处理方,各自拿回执对账。
我给这个设计的手法打高分:把一个抽象的「信任 AI」问题,切成可验证的数学部分和可赔付的商务部分。这套切法值得所有做 AI 安全和 AI 支付的团队抄。
六、裂缝
高分归高分,裂缝也要摆出来。实测加读文档,我找到四个。
第一个,demo 里签名者是 delta 自己。 正式产品里,用户签名是核心仪式:Ed25519 或 Passkey,证明用户授权过这条规则。但在对外开放的这个 preview 里,提交 proposal 的工具说明写得很直白,server 会替你签名并提交。签名本该证明「用户同意」,现在签名的人和被约束的利益方是同一个。preview 阶段这么设计可以理解,正式环境不能这样。用户手边没有签名动作的产品,授权链条就是断的。
第二个,API 响应里没有证明。 文档说判定带 ZK 证明,回执可独立验证。但我实际拿到的 outcome 里只有状态、证据、失败约束列表,没有任何 proof 或 receipt 工件。ZK 在宣传里存在,在 API 里缺席。也许是 preview 的简化,也许是还没做完。签了名的回执我暂时只能选择相信他们文档。
第三个,写规则的和被拦的是同一个 agent。 这是我认为最深的一个。流程里 policy 由 agent 起草,用户看到的是自然语言描述和一份自己读不懂的 DSL。如果 agent 被注入了,或者就是想绕开限制,它在起草规则时留个后门就行,反正用户大概率盲签。写护栏的和翻护栏的是同一类东西,这个利益冲突没有解。产品把 prompt 注入问题从执行层挪到了规则层,没有消除它。Mandate Guarantee 能兜住引擎算错,兜不住规则本身写歪。
第四个,能力边界就是结构化数据的边界。 证据提取今天只支持 UCP,Shopify 的结构化目录。客户自有系统要跟他们共建,非结构化网页还在路线图上。团队成员 Ole Hylland Spjeldnæs 在 X 上说得更直接:商家必须是 mandate 的一部分,这排除了开放网络购物。开放网络恰恰是 agent 购物最野、最需要护栏的地方。27.3% 到 0% 的成绩单,只在数据干净的世界里成立。
另有一个小裂缝说明文档在追赶实现:语言指南说品牌字段提取不了、写了会静默失败,我实测 Radley 的品牌字段提取正常。文档滞后,方向是好的那种滞后,功能跑在文档前面。
七、协议打架,执行层空着
把镜头拉远,看看这个赛道现在什么局面。
agentic payments 今年是协议混战。OpenAI 和 Stripe 搞了 ACP,核心原语是共享支付令牌。Google 推 AP2,主打信任和互操作。Coinbase 有 x402。Visa 有 TAP,Mastercard 有 Agent Pay,支付巨头全下了场。商品发现这层,Shopify 的 UCP 正在变成事实标准,我这次测试装的 ucp CLI 就是他们家的。
delta 自己首页画了一张分层图:发现层是 ACP 和 UCP,授权层是 AP2 和 Verifiable Intent,执行层只有 delta 一个名字,底下才是卡、ACH、稳定币这些支付轨道。FAQ 第一问就是「delta 跟 AP2、ACP、Verifiable Intent 竞争吗」,答案是不竞争,我是他们旁边那层。
这个卡位是聪明的。协议层巨头扎堆,全是标准之争,烧钱且赢家通吃。执行验证这一层,目前确实没有成建制的玩家,而需求是真的:每一个做 agentic 支付的平台,迟早都要回答「agent 买错了谁负责」。
商业模式也跟上一世划清了界限。不发币,不做链,managed SaaS,API 按用收费,客户是平台不是个人。上一世的加密 primitives 全部沉到水下,水面上是一个 B2B API 生意。
八、判断
三个判断,按把握从大到小排。
这次转型是真的,不是换皮。 判断依据不是文案,是构成。签名、内容寻址、ZK,上一世的核心产出全部出现在新产品的关键位置,且各自解决真问题:签名解决授权,内容寻址解决规则不可篡改,ZK 解决评估可审计。团队两年攒的技术没有作废,换了个出价更高的买家。这类真转型在加密圈是少数派,值得记一笔。
真创新是赔付设计,不是密码学。 ZK 判卷谁都能讲,把「验证不了的部分」明码标价赔出来,这个商业设计目前没看到第二家。这本质上是把信任问题转化成精算问题:错误率够低、赔付可预算,这个模型就跑得通。他们的基准测试给了错误率的分子,Mandate Guarantee 给了分母上的责任上限。这套东西成立的前提,是提取层别崩,而提取层的 LLM 特性决定了长尾错误杀不死,只能压低。精算模型对长尾是最脆弱的,这是他们未来最可能出事的地方。
policy 谁写,这个死结不解,天花板有限。 理想形态是用户用自然语言说需求,系统生成规则,用户看一眼摘要就签。现在卡在中间:agent 写规则,用户盲签 DSL。短期可以靠平台客户在前面做一层审核挡一挡,长期这个问题必须解,不然执行层就是个贵一点的规则引擎。解法可能是签名前强制呈现规则的人话对照,可能是第三方规则审计,也可能是保险费率跟规则来源挂钩,agent 写的贵一点,人写便宜一点。谁先解掉,谁吃掉这层。
最后猜一下终局。执行验证这个 niche,独立做大的窗口存在,但不会太宽。支付巨头的协议层打完架,迟早会注意到旁边这块地。对 delta 来说,好的结局是被 Stripe 或 Visa 收编, primitives 和赔付设计直接灌进巨头的协议里,团队拿一个体面的价格离场。坏的结局是开放网络提取一直做不出来,产品被锁死在 Shopify 目录里,变成一个高级插件。以他们两次转型的速度,我倾向认为他们还有第三次变形的机会。
至少这一世,他们把「crypto 技术卖给美元客户」这条路走通了。2024 年入行的同行们,可以参考这份作业。
本文基于公开信息撰写,不构成投资建议。