一切皆可评测:DSH 三个硬细节 × 六篇论文,给评测管线的实战清单

把 Hugo Zhu 的 DSH 三细节文章与六篇论文精读笔记,揉成一份日常工作清单

来源说明:本文把 Hugo Zhu 的《一切皆插件:DeepSeek Harness 真正硬核的是三个细节》(https://hugozhu.site/post/2026/348-dsh-three-details-reversible-effects/)与我近两周采集的六篇论文笔记揉在一起——DSec(arXiv:2609.22978)§1 中英对照精读、CodeAssay(arXiv:2608.03535)与 CCTU(arXiv:2603.15309)中文精读、GAUGE(arXiv:2609.12191)精读、Efficient Benchmarking in Production(arXiv:2609.21267)与 How Do Agent Harnesses Create Value?(arXiv:2609.20474)每日进修精简版。目标只有一个:落到算法评测的日常工作——评测链路搭建和线上问题追踪分析——能直接抄作业。


一、DSH 三个细节速览(先对齐上下文)

细节一:注册即副作用,卸载即回滚。 插件每注册一个能力(注册工具、监听事件、挂路由),同时登记一个对应的清理动作;卸载或重载时一起撤销。官方原话:registrations are effects that unwind when their plugin unloads。原文点评:可替换是口号,可回滚才是能力。

细节二:模型看见的一切,必须能在日志里找到。 Session 不是聊天记录,是仅追加的事件日志(append-only event log):模型可见的所有消息都从这份日志推导,工具调用、工具结果、流式 chunk 全部写回同一处。每轮还写入 request header 快照——供应商、模型名、思考强度、系统提示词、工具目录。一份日志解决五件事:恢复、分叉、回放、检索、审计。硬原则:上下文压缩、截断、摘要,任何对历史的加工如果不可回溯,恢复出来的 Agent 就不再是原来那个 Agent。

细节三:工具可以乱序完成,写回必须按原序。 模型一次吐出多个工具调用,允许并行的先进并行池(默认上限 10),但写回模型的结果仍按最初调用顺序排列——因为同一轮上下文是模型的推理基础,顺序抖动不会报错,只会让后续推理悄悄变味。任务取消时,已启动的尽量收尾,来不及启动的写合成结果,日志里永远不凭空少半截工具链。

附带的安全提醒:插件是宿主代码。 三档权限(只读 / 工作区可写 / 完全访问)管的是模型行为;但装进 Profile 的第三方插件不经过沙箱,权限接近 dsh 进程本身,要按"即将在你机器上以你权限运行的程序"来审查。web_fetch 默认关闭、创造模式≈给 Agent Shell 权限,都是官方警惕的信号。

原文的使用建议: 现阶段最大价值是学习不是日常使用——可逆副作用怎么设计、事件日志怎么做脊柱、上下文三道控制线怎么省 token,答案都能抄。一轮 14 步任务缓存命中率 93% 是实测参考。


二、为什么评测工程师要读这三个细节

原文最后一句值得单独拎出来:一个 Agent 运行时的可靠性,不体现在它跑得起来,而体现在它被打断、被替换、被取消之后,状态依然自洽。

[阅读全文]