<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Aitejiu 的博客</title><description>AI Agent · LLM Engineering</description><link>https://aitejiu.github.io/</link><language>zh_CN</language><item><title>Jev 工程评测：决策模型在 Agent Harness 中的应用边界</title><link>https://aitejiu.github.io/posts/jev-harness-eval/</link><guid isPermaLink="true">https://aitejiu.github.io/posts/jev-harness-eval/</guid><description>在 10 个公开数据集、约 22,500 次 API 调用（总成本 $2.19）上，对 TypeSafe Jev 决策模型的黑盒工程评测：哪些判断能直接进 agent harness，哪些完全不行，以及六条可复用的工程规律。</description><pubDate>Sat, 19 Sep 2026 00:00:00 GMT</pubDate><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;版本&lt;/strong&gt;：&lt;code&gt;jev-1.13.0&lt;/code&gt; · &lt;strong&gt;日期&lt;/strong&gt;：2026-09 · &lt;strong&gt;代码与原始数据&lt;/strong&gt;：&lt;a href=&quot;https://github.com/Aitejiu/jev-harness-lab&quot;&gt;github.com/Aitejiu/jev-harness-lab&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;本文是一份黑盒工程评测记录：在 10 个公开数据集上、以约 22,500 次 API 调用（52.2M input tokens，总成本 $2.19）测得的 Jev 能力边界、适用场景、工程规律与复现方法。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;摘要&lt;/h2&gt;
&lt;p&gt;Jev 是 TypeSafe AI 的 System One 决策模型：输入 &lt;code&gt;state&lt;/code&gt; + 类型化 &lt;code&gt;questions&lt;/code&gt;，输出带概率与置信度的结构化判断，不生成文本。本次评测覆盖 7 类任务，结论：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;适合（可直接用于 agent harness）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;能力&lt;/th&gt;
&lt;th&gt;数据集&lt;/th&gt;
&lt;th&gt;关键结果&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;间接注入检测&lt;/td&gt;
&lt;td&gt;InjecAgent（1,105 条）&lt;/td&gt;
&lt;td&gt;阈值 0.10：精确率/召回率 &lt;strong&gt;100%&lt;/strong&gt;，良性误报 0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;检索重排&lt;/td&gt;
&lt;td&gt;BEIR SciFact（900 对）&lt;/td&gt;
&lt;td&gt;BM25 → Jev：MRR &lt;strong&gt;0.622 → 0.843&lt;/strong&gt;，Hit@1 &lt;strong&gt;50% → 78.3%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;意图分类&lt;/td&gt;
&lt;td&gt;SNIPS / Banking77&lt;/td&gt;
&lt;td&gt;7 类 &lt;strong&gt;97.9%&lt;/strong&gt; / 77 类 &lt;strong&gt;80.3%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;工具目录路由&lt;/td&gt;
&lt;td&gt;MetaTool（199 工具）&lt;/td&gt;
&lt;td&gt;相似干扰 k=5 &lt;strong&gt;96.5%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Skill 路由&lt;/td&gt;
&lt;td&gt;SkillRetBench（501 skills）&lt;/td&gt;
&lt;td&gt;hybrid 架构 R@1 &lt;strong&gt;75.8%&lt;/strong&gt;（最强基线 38.0%）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;命令风险门控&lt;/td&gt;
&lt;td&gt;自建 130 条&lt;/td&gt;
&lt;td&gt;危险拦截 &lt;strong&gt;100%&lt;/strong&gt;、正常放行 &lt;strong&gt;98.2%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;工具相关性判定&lt;/td&gt;
&lt;td&gt;BFCL（1,140 条）&lt;/td&gt;
&lt;td&gt;两段式后 live 准确率 &lt;strong&gt;77.0%&lt;/strong&gt;（初版 59.5%）&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;不适合（负结果）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;任务&lt;/th&gt;
&lt;th&gt;结果&lt;/th&gt;
&lt;th&gt;原因&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;模型难度路由&lt;/td&gt;
&lt;td&gt;RouterBench：准确率 &lt;strong&gt;51%&lt;/strong&gt;（无信号）&lt;/td&gt;
&lt;td&gt;需要预测&quot;另一个模型会不会错&quot;，属元推理&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;长轨迹失败归因&lt;/td&gt;
&lt;td&gt;Who&amp;amp;When：AUROC &lt;strong&gt;0.560&lt;/strong&gt; ≈ 随机&lt;/td&gt;
&lt;td&gt;需要跨步骤因果与长上下文&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;非英语任务&lt;/td&gt;
&lt;td&gt;韩语 R@1 48.9% vs 英语 61.5%；中文路由 14.6% vs 英语 57.7%&lt;/td&gt;
&lt;td&gt;官方明示英语为主&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;核心工程结论（两条）&lt;/strong&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;边界模糊的语义判断，&lt;strong&gt;正交拆分 + 代码组合&lt;/strong&gt;显著优于单问句（命令门控误伤率 14.5% → 1.8%；工具相关性 59.5% → 77.0%）。&lt;/li&gt;
&lt;li&gt;多标签判断遵循 &lt;strong&gt;先 competition（choice 竞争出候选），再 verification（noul 验证集合成员）&lt;/strong&gt;，SkillRetBench 多技能组合 R@1 从 9.0% 提升到 81.0%。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;一句话：&lt;strong&gt;模型提供校准过的局部判断，代码持有控制流。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;1. 背景与对象&lt;/h2&gt;
&lt;h3&gt;1.1 为什么关注&quot;决策模型&quot;&lt;/h3&gt;
&lt;p&gt;Agent harness 的循环里充满高频、边界明确的窄判断：输入是否安全、请求属于哪类、该加载哪个 skill、命令能否执行、哪些片段进入上下文。若每个判断都调用前沿大模型，延迟与成本不可接受。Jev 的定位是这些判断的&quot;快思考层&quot;（System One）。&lt;/p&gt;
&lt;h3&gt;1.2 Jev 的接口形态&lt;/h3&gt;
&lt;pre&gt;&lt;code&gt;POST https://api.typesafe.ai/v1/systemone
Authorization: Bearer $TYPESAFE_API_KEY

{
  &quot;state&quot;: &quot;...&quot;,                // 字符串 / 对象 / 数组，仅文本
  &quot;model&quot;: &quot;jev-latest&quot;,
  &quot;questions&quot;: { &quot;...&quot; : Question }
}
&lt;/code&gt;&lt;/pre&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;原语&lt;/th&gt;
&lt;th&gt;语义&lt;/th&gt;
&lt;th&gt;返回字段&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;noul&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;是/否&lt;/td&gt;
&lt;td&gt;&lt;code&gt;noul&lt;/code&gt;：0~1 概率（&lt;strong&gt;无 confidence 字段&lt;/strong&gt;）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;choice&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;闭集单选&lt;/td&gt;
&lt;td&gt;&lt;code&gt;choice&lt;/code&gt; + &lt;code&gt;probabilities&lt;/code&gt; + &lt;code&gt;confidence&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;score&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;有序 rubric 评分&lt;/td&gt;
&lt;td&gt;&lt;code&gt;score&lt;/code&gt;（概率加权，可取小数）+ &lt;code&gt;legend&lt;/code&gt; + &lt;code&gt;probabilities&lt;/code&gt; + &lt;code&gt;confidence&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;1.3 已知限制（评测中均验证）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;choice&lt;/code&gt; 选项上限 &lt;strong&gt;255&lt;/strong&gt;；超出需分块或两阶段（SkillRouterBench 即使用 5×~101 分块）。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;state&lt;/code&gt; + &lt;code&gt;questions&lt;/code&gt; 共享约 &lt;strong&gt;32k tokens&lt;/strong&gt;；语料规模大时必须先检索。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仅文本&lt;/strong&gt;输入；主训练语言为英语。&lt;/li&gt;
&lt;li&gt;参考成本：$42 / billion input tokens；实测单次调用 P50 约 0.3s、约 $0.00004。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;2. 评测方法&lt;/h2&gt;
&lt;h3&gt;2.1 框架&lt;/h3&gt;
&lt;p&gt;统一流程（&lt;code&gt;eval/&lt;/code&gt; 目录，全部脚本开源）：&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;数据集加载 → 构造 state/questions → 并发调用（JSONL 缓存，可断点续跑）
          → 指标计算（阈值扫描 / 覆盖率曲线 / 校准 / 成本）→ Markdown 报告
&lt;/code&gt;&lt;/pre&gt;
&lt;h3&gt;2.2 指标定义（重要，避免口径混淆）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;阈值扫描&lt;/strong&gt;：将 &lt;code&gt;noul&lt;/code&gt; 概率或 &lt;code&gt;choice&lt;/code&gt; 概率作为分数，扫描判定阈值，报告 precision / recall / F1 / FPR。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;置信度门控曲线&lt;/strong&gt;：&lt;code&gt;noul&lt;/code&gt; 无 confidence 字段，采用 &lt;code&gt;certainty = max(p, 1-p)&lt;/code&gt; 代理；低于阈值视为&quot;不确定 → 转人工&quot;，输出&lt;strong&gt;覆盖率 vs 覆盖内准确率&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;条件 Hit@1&lt;/strong&gt;（SkillRet 实验）：金标候选在短名单内时，模型选中金标的比例；用于隔离&quot;选择器&quot;能力与&quot;召回&quot;能力。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;macro 平均&lt;/strong&gt;（SkillRetBench）：对 5 个设置分别计算后取算术平均。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;成本&lt;/strong&gt;：按 usage.input_tokens × $42/B 估算（不含输出 token 计费项，若官方另行计费则实际略高）。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;2.3 数据集清单&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;数据集&lt;/th&gt;
&lt;th&gt;规模&lt;/th&gt;
&lt;th&gt;用途&lt;/th&gt;
&lt;th&gt;来源&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;InjecAgent&lt;/td&gt;
&lt;td&gt;1,054 注入 + 51 良性&lt;/td&gt;
&lt;td&gt;间接注入检测&lt;/td&gt;
&lt;td&gt;GitHub &lt;code&gt;uiuc-kang-lab/InjecAgent&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;neuralchemy prompt-injection&lt;/td&gt;
&lt;td&gt;942&lt;/td&gt;
&lt;td&gt;注入检测（对照）&lt;/td&gt;
&lt;td&gt;HF &lt;code&gt;neuralchemy/Prompt-injection-dataset&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;合成工具输出注入&lt;/td&gt;
&lt;td&gt;80 注入 + 41 良性&lt;/td&gt;
&lt;td&gt;注入检测（工具输出包装）&lt;/td&gt;
&lt;td&gt;本仓库构造&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BEIR SciFact&lt;/td&gt;
&lt;td&gt;60 查询 × 15 候选&lt;/td&gt;
&lt;td&gt;检索重排&lt;/td&gt;
&lt;td&gt;BEIR / SciFact&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SNIPS&lt;/td&gt;
&lt;td&gt;1,400&lt;/td&gt;
&lt;td&gt;意图分类（7 类）&lt;/td&gt;
&lt;td&gt;HF &lt;code&gt;benayas/snips&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Banking77&lt;/td&gt;
&lt;td&gt;3,080&lt;/td&gt;
&lt;td&gt;意图分类（77 类）&lt;/td&gt;
&lt;td&gt;&lt;code&gt;PolyAI-LDN/task-specific-datasets&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MetaTool ToolE&lt;/td&gt;
&lt;td&gt;20,614 查询 / 199 工具&lt;/td&gt;
&lt;td&gt;工具路由&lt;/td&gt;
&lt;td&gt;GitHub &lt;code&gt;HowieHwong/MetaTool&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BFCL v3&lt;/td&gt;
&lt;td&gt;1,140（irrelevance/relevance）&lt;/td&gt;
&lt;td&gt;工具相关性判定&lt;/td&gt;
&lt;td&gt;HF &lt;code&gt;gorilla-llm/Berkeley-Function-Calling-Leaderboard&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SkillRet&lt;/td&gt;
&lt;td&gt;6,006 skills / 300 查询&lt;/td&gt;
&lt;td&gt;Skill 召回+选择&lt;/td&gt;
&lt;td&gt;HF &lt;code&gt;ThakiCloud/SKILLRET&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SkillRetBench&lt;/td&gt;
&lt;td&gt;501 skills / 1,250 查询&lt;/td&gt;
&lt;td&gt;Skill 路由（含官方基线）&lt;/td&gt;
&lt;td&gt;HF &lt;code&gt;thaki-AI/SkillRetBench&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RouterBench&lt;/td&gt;
&lt;td&gt;825 抽样&lt;/td&gt;
&lt;td&gt;模型难度路由（负）&lt;/td&gt;
&lt;td&gt;HF &lt;code&gt;withmartian/routerbench&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Who&amp;amp;When&lt;/td&gt;
&lt;td&gt;184 轨迹 × 8 步&lt;/td&gt;
&lt;td&gt;失败步骤归因（负）&lt;/td&gt;
&lt;td&gt;GitHub &lt;code&gt;ag2ai/Agents_Failure_Attribution&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;自建 shell 命令集&lt;/td&gt;
&lt;td&gt;130（allow 55/review 35/deny 40）&lt;/td&gt;
&lt;td&gt;命令风险门控&lt;/td&gt;
&lt;td&gt;本仓库 &lt;code&gt;eval/datasets/bash_commands.jsonl&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr /&gt;
&lt;h2&gt;3. 实验与结果&lt;/h2&gt;
&lt;h3&gt;3.1 间接注入检测&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;InjecAgent（真实数据：17 个用户工具 × 62 条攻击指令）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阈值&lt;/th&gt;
&lt;th&gt;精确率&lt;/th&gt;
&lt;th&gt;召回率&lt;/th&gt;
&lt;th&gt;F1&lt;/th&gt;
&lt;th&gt;良性误报率&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;0.50&lt;/td&gt;
&lt;td&gt;100%&lt;/td&gt;
&lt;td&gt;89.8%&lt;/td&gt;
&lt;td&gt;94.7%&lt;/td&gt;
&lt;td&gt;0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;0.10&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;100%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;100%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;100%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;0%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;分类型召回（阈值 0.5）：data_stealing 98.5%、direct_harm 80.6%；良性样本均分 0.03。&lt;/li&gt;
&lt;li&gt;门控：certainty ≥ 0.90 时自动处置 41.1% 流量，覆盖内准确率 100%。&lt;/li&gt;
&lt;li&gt;成本 $0.0213 / 1,105 次；P50 0.30s、P95 0.41s。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;合成工具输出（把注入文本包进 WebFetch/Read/GitHub/Email 返回模板）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阈值&lt;/th&gt;
&lt;th&gt;精确率&lt;/th&gt;
&lt;th&gt;召回率&lt;/th&gt;
&lt;th&gt;F1&lt;/th&gt;
&lt;th&gt;良性误报率&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;0.50&lt;/td&gt;
&lt;td&gt;97.1%&lt;/td&gt;
&lt;td&gt;85.0%&lt;/td&gt;
&lt;td&gt;90.7%&lt;/td&gt;
&lt;td&gt;4.9%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;0.15（最佳 F1）&lt;/td&gt;
&lt;td&gt;93.0%&lt;/td&gt;
&lt;td&gt;100%&lt;/td&gt;
&lt;td&gt;96.4%&lt;/td&gt;
&lt;td&gt;14.6%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;漏报集中在&lt;strong&gt;编码绕过&lt;/strong&gt;（西里尔同形字、代码片段伪装）。&lt;/li&gt;
&lt;li&gt;certainty ≥ 0.90：覆盖率 62.0%、覆盖内准确率 100%。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;对照：neuralchemy（任务不匹配的教训）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阈值&lt;/th&gt;
&lt;th&gt;精确率&lt;/th&gt;
&lt;th&gt;召回率&lt;/th&gt;
&lt;th&gt;F1&lt;/th&gt;
&lt;th&gt;良性误报率&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;0.50&lt;/td&gt;
&lt;td&gt;97.4%&lt;/td&gt;
&lt;td&gt;55.1%&lt;/td&gt;
&lt;td&gt;70.4%&lt;/td&gt;
&lt;td&gt;2.1%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;0.05（最佳 F1）&lt;/td&gt;
&lt;td&gt;95.6%&lt;/td&gt;
&lt;td&gt;94.2%&lt;/td&gt;
&lt;td&gt;94.9%&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;该数据集将&quot;请求有害内容&quot;也标为恶意，而我们的 criteria 只问&quot;是否覆盖/提取系统指令&quot;——召回低的主因是&lt;strong&gt;任务定义不匹配&lt;/strong&gt;，而非能力上限。另注意校准：0~0.1 分桶中仍有 16.6% 恶意样本，&lt;strong&gt;低分不等于安全&lt;/strong&gt;。&lt;/p&gt;
&lt;h3&gt;3.2 检索重排（BEIR SciFact）&lt;/h3&gt;
&lt;p&gt;60 查询 × 15 候选（BM25 top-15 内混入标注相关文档），Jev 对每个 (query, document) 打 0-3 相关性分后重排：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;排序器&lt;/th&gt;
&lt;th&gt;Recall@5&lt;/th&gt;
&lt;th&gt;Precision@5&lt;/th&gt;
&lt;th&gt;MRR&lt;/th&gt;
&lt;th&gt;nDCG@5&lt;/th&gt;
&lt;th&gt;Hit@1&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;BM25&lt;/td&gt;
&lt;td&gt;74.2%&lt;/td&gt;
&lt;td&gt;15.7%&lt;/td&gt;
&lt;td&gt;0.622&lt;/td&gt;
&lt;td&gt;0.632&lt;/td&gt;
&lt;td&gt;50.0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Jev&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;90.0%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;19.3%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;0.843&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;0.848&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;78.3%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;相关文档均分 2.38 vs 不相关 0.65。&lt;/li&gt;
&lt;li&gt;成本 $0.028 / 900 对；P50 0.31s。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3.3 意图与目录路由&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;数据集&lt;/th&gt;
&lt;th&gt;类别/目录&lt;/th&gt;
&lt;th&gt;Top-1&lt;/th&gt;
&lt;th&gt;Top-3&lt;/th&gt;
&lt;th&gt;门控&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;SNIPS（1,400）&lt;/td&gt;
&lt;td&gt;7 类&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;97.9%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;99.7%&lt;/td&gt;
&lt;td&gt;conf≥0.90：覆盖 93.6%、准确率 99.1%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Banking77（3,080）&lt;/td&gt;
&lt;td&gt;77 类&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;80.3%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;91.7%&lt;/td&gt;
&lt;td&gt;conf≥0.90：覆盖 67.8%、准确率 92.8%；conf≥0.99：46.1% / 97.0%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;MetaTool（199 工具目录，干扰项用 BM25 选最相似工具）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;选项数 k&lt;/th&gt;
&lt;th&gt;随机干扰 Top-1&lt;/th&gt;
&lt;th&gt;相似干扰 Top-1&lt;/th&gt;
&lt;th&gt;随机基线&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;5&lt;/td&gt;
&lt;td&gt;98.0%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;96.5%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;20%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;10&lt;/td&gt;
&lt;td&gt;96.0%&lt;/td&gt;
&lt;td&gt;92.0%&lt;/td&gt;
&lt;td&gt;10%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;20&lt;/td&gt;
&lt;td&gt;92.5%&lt;/td&gt;
&lt;td&gt;88.5%&lt;/td&gt;
&lt;td&gt;5%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;参考：MetaTool 论文 similar 子任务 ChatGPT 69.1%、Baichuan2 59.1%、Vicuna-33b 54.0%（评测口径不完全相同，量级参考）。&lt;/li&gt;
&lt;li&gt;错例集中在近义工具对（如 &lt;code&gt;VideoSummarizeTool&lt;/code&gt; vs &lt;code&gt;video_highlight&lt;/code&gt;），少量高置信错误——&lt;strong&gt;目录描述需显式写边界（not_for）&lt;/strong&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3.4 命令风险门控（自建 130 条）&lt;/h3&gt;
&lt;p&gt;设计：4 个正交 &lt;code&gt;noul&lt;/code&gt;（破坏性 / 触密 / 外发 / 不可逆）+ 代码组合决策（deny/review/allow）。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方案&lt;/th&gt;
&lt;th&gt;三分类一致率&lt;/th&gt;
&lt;th&gt;危险命令拦截率&lt;/th&gt;
&lt;th&gt;正常命令放行率&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;v1（宽松 criteria）&lt;/td&gt;
&lt;td&gt;66.2%&lt;/td&gt;
&lt;td&gt;85.0%&lt;/td&gt;
&lt;td&gt;87.3%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;v2（收紧 criteria）&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;78.5%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;100%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;98.2%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;单问句 choice 基线&lt;/td&gt;
&lt;td&gt;77.7%&lt;/td&gt;
&lt;td&gt;100%&lt;/td&gt;
&lt;td&gt;85.5%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;v1 漏掉&quot;可用性破坏&quot;类（fork bomb、reboot、iptables 锁死）；criteria 补上&quot;失去可用性&quot;后全部拦截。&lt;/li&gt;
&lt;li&gt;阈值网格搜索最优三分类一致率仅 79.2%——余下误差来自 review 语义本身的模糊，非阈值问题。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;正交拆分的收益体现在误伤率&lt;/strong&gt;：14.5% → 1.8%。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3.5 工具相关性判定（BFCL，三版迭代）&lt;/h3&gt;
&lt;p&gt;任务：给定用户请求 + 函数列表，判断&quot;是否至少有一个函数应被调用&quot;。样本 1,140（不可调用 1,122 / 应调用 18）。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;版本&lt;/th&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;classic 准确率&lt;/th&gt;
&lt;th&gt;live_irrelevance 准确率&lt;/th&gt;
&lt;th&gt;整体误报率&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;v1&lt;/td&gt;
&lt;td&gt;单 noul：&quot;是否相关&quot;&lt;/td&gt;
&lt;td&gt;84.2%&lt;/td&gt;
&lt;td&gt;59.5%&lt;/td&gt;
&lt;td&gt;35.2%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;v2&lt;/td&gt;
&lt;td&gt;criteria 收紧为&quot;用途直接匹配&quot;&lt;/td&gt;
&lt;td&gt;89.6%&lt;/td&gt;
&lt;td&gt;67.3%&lt;/td&gt;
&lt;td&gt;27.9%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;v2c&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;两步组合：&lt;code&gt;purpose_match × (1 − incidental_only)&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;90.8%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;77.0%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;20.1%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;v2c 门控：certainty ≥ 0.95 → 覆盖率 61.8%、覆盖内准确率 99.1%；≥ 0.98 → 39.5% / 100%。&lt;/li&gt;
&lt;li&gt;典型失败模式：&quot;技术上能用&quot;被当成&quot;语义上该用&quot;（通用 &lt;code&gt;requests.get&lt;/code&gt; 被判相关）。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3.6 Skill Router（SkillRet + SkillRetBench）&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;背景&lt;/strong&gt;：skill 目录持续膨胀，全部注入主模型上下文既昂贵又干扰。目标：请求进入时用一次 Jev 判断&quot;加载哪个 skill&quot;。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SkillRet（6,006 skills，300 查询）——隔离召回与选择&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;配置&lt;/th&gt;
&lt;th&gt;BM25 Hit@1&lt;/th&gt;
&lt;th&gt;短名单召回&lt;/th&gt;
&lt;th&gt;Jev 端到端 Hit@1&lt;/th&gt;
&lt;th&gt;条件 Hit@1*&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;k=10 仅名称+描述&lt;/td&gt;
&lt;td&gt;52.7%&lt;/td&gt;
&lt;td&gt;71.3%&lt;/td&gt;
&lt;td&gt;63.7%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;89.3%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;k=10 criteria 带 body&lt;/td&gt;
&lt;td&gt;52.7%&lt;/td&gt;
&lt;td&gt;71.3%&lt;/td&gt;
&lt;td&gt;63.0%&lt;/td&gt;
&lt;td&gt;88.3%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;k=20 criteria 带 body&lt;/td&gt;
&lt;td&gt;52.7%&lt;/td&gt;
&lt;td&gt;77.3%&lt;/td&gt;
&lt;td&gt;65.3%&lt;/td&gt;
&lt;td&gt;84.5%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;k=10 &lt;strong&gt;BM25 索引含 body&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;58.3%&lt;/td&gt;
&lt;td&gt;78.7%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;68.3%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;86.9%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;* 条件 Hit@1 = 金标在短名单内时选中比例。结论：&lt;strong&gt;选择器强（85~89%），瓶颈在召回&lt;/strong&gt;；把 body 加入检索索引直接抬高端到端。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SkillRetBench（501 skills、5 设置 × 100 查询，与官方基线同口径）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;指标（macro）&lt;/th&gt;
&lt;th&gt;BM25&lt;/th&gt;
&lt;th&gt;Dense&lt;/th&gt;
&lt;th&gt;Hybrid&lt;/th&gt;
&lt;th&gt;NaiveLLM&lt;/th&gt;
&lt;th&gt;SADO&lt;/th&gt;
&lt;th&gt;Jev chunked&lt;/th&gt;
&lt;th&gt;&lt;strong&gt;Jev hybrid&lt;/strong&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Recall@1&lt;/td&gt;
&lt;td&gt;38.0%&lt;/td&gt;
&lt;td&gt;11.8%&lt;/td&gt;
&lt;td&gt;22.8%&lt;/td&gt;
&lt;td&gt;30.2%&lt;/td&gt;
&lt;td&gt;26.6%&lt;/td&gt;
&lt;td&gt;60.4%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;75.8%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Recall@3&lt;/td&gt;
&lt;td&gt;49.2%&lt;/td&gt;
&lt;td&gt;22.2%&lt;/td&gt;
&lt;td&gt;33.0%&lt;/td&gt;
&lt;td&gt;40.4%&lt;/td&gt;
&lt;td&gt;36.8%&lt;/td&gt;
&lt;td&gt;75.4%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;87.6%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Recall@10&lt;/td&gt;
&lt;td&gt;59.8%&lt;/td&gt;
&lt;td&gt;36.5%&lt;/td&gt;
&lt;td&gt;48.2%&lt;/td&gt;
&lt;td&gt;55.6%&lt;/td&gt;
&lt;td&gt;52.0%&lt;/td&gt;
&lt;td&gt;87.6%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;93.0%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;nDCG@10&lt;/td&gt;
&lt;td&gt;53.4%&lt;/td&gt;
&lt;td&gt;26.8%&lt;/td&gt;
&lt;td&gt;39.1%&lt;/td&gt;
&lt;td&gt;45.1%&lt;/td&gt;
&lt;td&gt;42.9%&lt;/td&gt;
&lt;td&gt;60.3%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;70.2%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MRR@10&lt;/td&gt;
&lt;td&gt;57.3%&lt;/td&gt;
&lt;td&gt;29.1%&lt;/td&gt;
&lt;td&gt;42.5%&lt;/td&gt;
&lt;td&gt;50.0%&lt;/td&gt;
&lt;td&gt;46.8%&lt;/td&gt;
&lt;td&gt;69.3%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;82.4%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;（部分官方基线为模拟实现，见 SkillRetBench 数据集说明；BM25/Dense/Hybrid 为真实检索器。）&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;三版架构建模（多技能组合是分水岭）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;设置 R@1&lt;/th&gt;
&lt;th&gt;v1 chunked（每块单选）&lt;/th&gt;
&lt;th&gt;v2 multiselect（逐候选 noul）&lt;/th&gt;
&lt;th&gt;&lt;strong&gt;v3 hybrid（choice → noul 验证）&lt;/strong&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;single_skill&lt;/td&gt;
&lt;td&gt;65.0%&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;69.0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;multi_skill_composition&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;9.0%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;15.0%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;81.0%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;distractor&lt;/td&gt;
&lt;td&gt;66.0%&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;74.0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;outdated_redundant&lt;/td&gt;
&lt;td&gt;84.0%&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;92.0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;budget_constrained&lt;/td&gt;
&lt;td&gt;78.0%&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;63.0%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;v2 失败的诊断：逐问 &lt;code&gt;noul&lt;/code&gt; 分数集中在 0.5x（top10 均分 0.56），&lt;strong&gt;独立打分缺竞争性，合并排名成为噪声&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;v3 结构：分块 &lt;code&gt;choice&lt;/code&gt; 取每块 top-3（15 候选，概率有区分度）→ 一次请求内对 15 个候选逐问 &lt;code&gt;noul&lt;/code&gt;&quot;是否入集合&quot; → 合并排序。&lt;/li&gt;
&lt;li&gt;Set completeness（全部金标进入集合）：single 65%、multi 25%、outdated 91%——&lt;strong&gt;&quot;选全&quot;仍是弱项&lt;/strong&gt;，下一步方向。&lt;/li&gt;
&lt;li&gt;成本：hybrid $0.650 / 500 查询、P50 2.07s；生产同构的 bm25top50 $0.072 / 500 查询、P50 0.33s（R@1 54.8%）。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3.7 负结果&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;模型难度路由（RouterBench，825 条）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;策略&lt;/th&gt;
&lt;th&gt;平均质量&lt;/th&gt;
&lt;th&gt;平均成本&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;永远 cheap&lt;/td&gt;
&lt;td&gt;42.0%&lt;/td&gt;
&lt;td&gt;$0.00005&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;永远 strong&lt;/td&gt;
&lt;td&gt;80.3%&lt;/td&gt;
&lt;td&gt;$0.00249&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Jev 路由 @0.50&lt;/td&gt;
&lt;td&gt;42.4%&lt;/td&gt;
&lt;td&gt;$0.00005&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;判断准确率 &lt;strong&gt;51.3%&lt;/strong&gt;（无信号）；分数中位数 0.11，系统性偏向&quot;小模型能搞定&quot;。&lt;/li&gt;
&lt;li&gt;语言拆分：中文任务 14.6%（n=123） vs 英文 57.7%（n=702）。&lt;/li&gt;
&lt;li&gt;结论：从文本预测&quot;某个具体模型会不会错&quot;依赖模型特性，&lt;strong&gt;不是自然语言属性&lt;/strong&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;长轨迹失败归因（Who&amp;amp;When，184 轨迹 × 8 步 = 1,403 步）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;指标&lt;/th&gt;
&lt;th&gt;结果&lt;/th&gt;
&lt;th&gt;随机基线&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;步骤级 AUROC&lt;/td&gt;
&lt;td&gt;0.560&lt;/td&gt;
&lt;td&gt;0.5&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;轨迹级 top-1 定位&lt;/td&gt;
&lt;td&gt;16.3%&lt;/td&gt;
&lt;td&gt;12.5%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;失败步均分 vs 普通步&lt;/td&gt;
&lt;td&gt;0.42 vs 0.37&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;子集拆分：Algorithm-Generated 0.532 / Hand-Crafted 0.641，均不可用。&lt;/li&gt;
&lt;li&gt;失败定义包含&quot;从未被纠正&quot;，需要跨步骤因果推理——超出 System One 的形态。轨迹类任务若要使用 Jev，应改问&lt;strong&gt;局部可观察信号&lt;/strong&gt;（工具报错、重复动作、格式违规）。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;4. 与公开基准/文献的对照&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;同候选集对比（SkillRouter 论文，~80K skills，top-20 候选）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方案&lt;/th&gt;
&lt;th&gt;Hit@1&lt;/th&gt;
&lt;th&gt;性质&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;GPT-4o-mini（listwise judge）&lt;/td&gt;
&lt;td&gt;67.3%&lt;/td&gt;
&lt;td&gt;通用 LLM 直接排序&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPT-5.4-mini（listwise judge）&lt;/td&gt;
&lt;td&gt;66.0%&lt;/td&gt;
&lt;td&gt;同上&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Qwen3-Reranker-8B&lt;/td&gt;
&lt;td&gt;71.4%&lt;/td&gt;
&lt;td&gt;通用 reranker&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SkillRouter 1.2B&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;74.0%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;专用微调流水线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;R3（腾讯，中英双语）&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;77.1%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;专用微调（R3-Skill 上 NDCG@10 0.833）&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;论文原话：LLM-as-judge 基线 &quot;not competitive&quot;。&lt;strong&gt;通用大模型直接排序弱于专用重排器&lt;/strong&gt;；Jev 零样本、无训练，条件命中 86.9~89.3%（池规模与指标口径不同，仅作同档参考）。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SkillRet 论文重排实验（top-20 候选，nDCG@10）&lt;/strong&gt;：jina-reranker-v2 73.1、Qwen3-Reranker-0.6B/4B/8B 75.8~76.2、SkillRouter-Reranker 81.9、SkillRet-Reranker 82.2。重要发现：&lt;strong&gt;通用 reranker 接在强一阶段之后会掉点&lt;/strong&gt;（83.45 → 74~78）——若将 Jev 接强 embedding 召回，其边际价值需重测。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;5. 工程规律（六条）&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;criteria 即决策边界&lt;/strong&gt;。同一句话：&quot;physical harm &lt;strong&gt;or retaliation&lt;/strong&gt;&quot;混合 criteria 得 0.47 的模糊概率；拆成两个正交问题后为 0.04 / 0.96。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;正交拆分 + 代码组合优于单问句&lt;/strong&gt;。命令门控误伤 14.5% → 1.8%；工具相关性 live 59.5% → 77.0%。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;高分区可信，低分区不等于安全&lt;/strong&gt;。注入检测 ≥0.1 分样本 90%+ 为恶意，但 0~0.1 分桶仍有 16.6% 恶意——生产策略必须保留人工复核带。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;confidence ≠ correctness&lt;/strong&gt;。高置信只表示模型确信其在按你的定义判断；criteria 有误时同样自信（评测中出现 conf=1.0 的错误路由）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多标签：先 competition 后 verification&lt;/strong&gt;（见 §3.6）。独立 &lt;code&gt;noul&lt;/code&gt; 组硬打会把&quot;模糊相关&quot;与&quot;真正需要&quot;混在一起。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;能力边界纪律&lt;/strong&gt;。只问文本中局部可观察的模式；不问模型能力（51%），不问跨步因果（AUROC 0.56）。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr /&gt;
&lt;h2&gt;6. 集成与工具化&lt;/h2&gt;
&lt;p&gt;仓库提供两个可直接使用的集成（均为本次评测的直接产物）：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;MCP Server&lt;/strong&gt;（&lt;code&gt;mcp_server.py&lt;/code&gt;，stdio）&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;工具&lt;/th&gt;
&lt;th&gt;输入 → 输出&lt;/th&gt;
&lt;th&gt;实测&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;scan_injection&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;tool_output → &lt;code&gt;action&lt;/code&gt;(block/review/pass) + 概率&lt;/td&gt;
&lt;td&gt;注入文本 → block，p=0.98&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;bash_risk&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;command → &lt;code&gt;action&lt;/code&gt; + 四维分数&lt;/td&gt;
&lt;td&gt;&lt;code&gt;rm -rf /&lt;/code&gt; → deny&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;rank_candidates&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;query + candidates(≤10) → 排序&lt;/td&gt;
&lt;td&gt;密码重置文档排第一&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Skill Router&lt;/strong&gt;（&lt;code&gt;skill_router.py&lt;/code&gt; + opencode 插件 &lt;code&gt;integrations/opencode/jev-skill-router.ts&lt;/code&gt;）
请求进入时用 Jev 从本地 skill 目录选一个并返回完整 SKILL.md；参考配置 &lt;code&gt;agent.build.tools.skill = false&lt;/code&gt;（主模型上下文不再携带 skill 目录）。本地 35 个 skill 的中文查询路由全部正确，无匹配时正确返回&quot;无需 skill&quot;。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;7. 复现指南&lt;/h2&gt;
&lt;pre&gt;&lt;code&gt;git clone https://github.com/Aitejiu/jev-harness-lab
cd jev-harness-lab
uv venv --python 3.12 .venv
uv pip install -r requirements.txt
echo &quot;TYPESAFE_API_KEY=&amp;lt;your-key&amp;gt;&quot; &amp;gt; .env
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;数据下载（脚本内注释含来源；&lt;code&gt;eval/data/&lt;/code&gt; 已 gitignore）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;InjecAgent / neuralchemy / SNIPS / Banking77 / MetaTool / SkillRet / SkillRetBench / RouterBench / Who&amp;amp;When：按 &lt;code&gt;eval/README.md&lt;/code&gt; 中对应小节下载；&lt;/li&gt;
&lt;li&gt;自建数据集（shell 命令集）已随仓库提交。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;运行示例：&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;# 注入检测（InjecAgent）
.venv/bin/python eval/run_injecagent.py --concurrency 6
# 检索重排
.venv/bin/python eval/run_rerank.py --queries 60
# 命令风险门控（v2）
.venv/bin/python eval/run_bash.py --variant v2
# Skill Router（同数据集对比，hybrid 架构）
.venv/bin/python eval/run_skillretbench.py --variant hybrid --per-setting 100
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;结果缓存在 &lt;code&gt;eval/results/*.jsonl&lt;/code&gt;（已提交），重复运行只补缺失样本；加 &lt;code&gt;--report-only&lt;/code&gt; 可直接用缓存重新生成报告。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;8. 局限与版本说明&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;结论基于 &lt;strong&gt;&lt;code&gt;jev-1.13.0&lt;/code&gt;&lt;/strong&gt; 单一版本；模型更新后建议按本文流程复测。&lt;/li&gt;
&lt;li&gt;部分数据集为抽样或自建（shell 命令集 130 条、合成注入 121 条、SciFact 60 查询），存在选择偏差。&lt;/li&gt;
&lt;li&gt;阈值均为评测参考值，生产阈值必须在自有数据上标定（建议用覆盖率-准确率曲线选点）。&lt;/li&gt;
&lt;li&gt;成本按 input token 估算；若官方对 output token 单独计费，实际成本略高。&lt;/li&gt;
&lt;li&gt;英语为主：中文/韩文任务在放量前需专项验证。&lt;/li&gt;
&lt;li&gt;SkillRetBench 的 NaiveLLM/SADO 基线为模拟实现（数据集方声明），对比仅作参考。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;附录：关键源文件&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;内容&lt;/th&gt;
&lt;th&gt;文件&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;注入检测&lt;/td&gt;
&lt;td&gt;&lt;code&gt;eval/run_injecagent.py&lt;/code&gt;、&lt;code&gt;eval/run_toolinject.py&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;检索重排&lt;/td&gt;
&lt;td&gt;&lt;code&gt;eval/run_rerank.py&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;意图/目录路由&lt;/td&gt;
&lt;td&gt;&lt;code&gt;eval/run_intent.py&lt;/code&gt;、&lt;code&gt;eval/run_agentroute.py&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;命令门控&lt;/td&gt;
&lt;td&gt;&lt;code&gt;eval/run_bash.py&lt;/code&gt;、&lt;code&gt;eval/datasets/bash_commands.jsonl&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;工具相关性&lt;/td&gt;
&lt;td&gt;&lt;code&gt;eval/run_bfcl.py&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Skill 路由&lt;/td&gt;
&lt;td&gt;&lt;code&gt;eval/run_skillret.py&lt;/code&gt;、&lt;code&gt;eval/run_skillretbench.py&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;负结果&lt;/td&gt;
&lt;td&gt;&lt;code&gt;eval/run_router.py&lt;/code&gt;、&lt;code&gt;eval/run_whowhen.py&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;全线报告&lt;/td&gt;
&lt;td&gt;&lt;code&gt;eval/results/*.md&lt;/code&gt;（24 份）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;集成&lt;/td&gt;
&lt;td&gt;&lt;code&gt;mcp_server.py&lt;/code&gt;、&lt;code&gt;skill_router.py&lt;/code&gt;、&lt;code&gt;integrations/opencode/&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;数据集与参考&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;InjecAgent：https://github.com/uiuc-kang-lab/InjecAgent&lt;/li&gt;
&lt;li&gt;BEIR SciFact：https://github.com/beir-cellar/beir&lt;/li&gt;
&lt;li&gt;MetaTool：https://github.com/HowieHwong/MetaTool&lt;/li&gt;
&lt;li&gt;BFCL：https://gorilla.cs.berkeley.edu/leaderboard.html&lt;/li&gt;
&lt;li&gt;SkillRet：https://huggingface.co/datasets/ThakiCloud/SKILLRET&lt;/li&gt;
&lt;li&gt;SkillRetBench：https://huggingface.co/datasets/thaki-AI/SkillRetBench&lt;/li&gt;
&lt;li&gt;RouterBench：https://huggingface.co/datasets/withmartian/routerbench&lt;/li&gt;
&lt;li&gt;Who&amp;amp;When：https://github.com/ag2ai/Agents_Failure_Attribution&lt;/li&gt;
&lt;li&gt;SkillRouter 论文：arXiv:2603.22455&lt;/li&gt;
&lt;li&gt;R3-Skill 论文：arXiv:2606.03565&lt;/li&gt;
&lt;li&gt;TypeSafe 文档：https://docs.typesafe.ai&lt;/li&gt;
&lt;/ul&gt;
</content:encoded></item></channel></rss>