【Agent Engineering Radar】2026-09-16 Agent 工程技术雷达

本期观察窗口为 9 月 2–16 日,收录四条公开信号:Skills 的协议分发、追踪数据保留期限、统一评测环境,以及长任务的边际收益。个人 Agent 栈本周最值得做的是检查证据能保存多久、技能从哪里来、追加预算是否仍然有效。

This Week’s Signal

日期 新信号 工程意义
9 月 13 日 MCP Skills Extension 的 SEP-2640 合并 技能分发有了扩展层的共同约定;不代表客户端已普遍支持。[1]
9 月 14 日起 LangSmith SaaS 新摄入的 extended-retention traces 最多保留 180 天 长期回归所需证据不能只依赖在线追踪存储;自托管和 BYOC 不受此次调整影响。[2]
9 月 3 日首发、10 日修订 Harbor Adapters / Harbor-Index 公开评测基础设施 统一环境与 harness 对比让跨基准评测更可操作。[3]
9 月 14 日 Elo-per-token 分析论文发布 在论文实验范围内,长任务追加 token 的边际收益会下降;值得测量何时停止或重启。[4]

以下分区是本文的工程判断与建议,不是项目方的成熟度认证,也不代表已经完成本地实测。

Adopt

先检查追踪证据的保留与恢复路径。 LangSmith 官方明确:原来超过 180 天的配置,对新摄入 trace 按 180 天处理,新的超限配置会被拒绝。[2] 这是已生效的服务规则,成熟度高;风险是长期回归时找不到原始轨迹。使用该服务时,下一步应核查配置,并为获准保留的少量回归样本建立脱敏导出与恢复检查。不要把这一变化误读为历史数据立即全部删除,也不要无差别永久保存工具输出。

Trial

在隔离环境试用 MCP Skills 分发。 SEP-2640 在 Extensions Track 定义通过 MCP 提供 Agent Skills 的 skill:// 资源约定,扩展标识为 io.modelcontextprotocol/skills。[1] 它有助于减少技能分发的专有接法,但目前应按已合并规范、客户端支持待逐一核实来判断成熟度。风险在于把远端技能文本误当成可信执行授权。下一步只选一个公开、可审阅的技能,固定版本并验证发现、获取和拒绝不受支持扩展的行为;执行权限仍由宿主控制。

用 Harbor 做小规模、固定条件的 harness 对照。 论文报告适配了 80 多个 benchmark,并在 54 个 benchmark 上评测 8 个模型;Harbor-Index 则从 29 个 benchmark 中筛选出 82 个任务。[3] 意义是减少环境接入重复工作,而不是给所有个人任务提供统一答案。成熟度属于公开研究与工具阶段;环境依赖、运行成本和任务代表性仍是风险。下一步挑选少量与自身使用场景相近的公开任务,固定模型、预算和环境版本,再比较两种 harness 的成功率、耗时与失败轨迹。

Watch

关注预算曲线,暂不照搬论文停止阈值。 Elo-per-token 方法在不同 token 预算处跟踪最佳解,再汇总跨任务的相对表现。研究覆盖四个通用 Agent、四个开放式 benchmark,并观察到相对独立采样参照的边际收益衰减。[4] 它为预算策略提供了可检验方向,但仍是预印本,不能直接推广到所有编码、检索或业务任务。下一步在有可验证中间结果的任务上设置三档预算,记录质量与成本,再决定是否尝试停止后独立重跑。

Hold/Risks

  • 暂缓自动执行远端 Skills:规范合并只解决互操作的一部分。来源审阅和最小权限仍需独立落实;先通过隔离试验再扩大范围。[1]
  • 暂缓依赖单一在线平台保存长期评测证据:服务保留政策会影响可复现性。先验证必要样本可恢复,并控制导出数据的敏感性。[2]
  • 暂缓以榜单分数或运行时长作为升级理由:公开评测的成熟度不等于对个人栈的适配度。先复测代表性任务,并比较相同成本下的收益。[3][4]

Practical Stack Adjustments

下面把本周信号转成个人栈的检查问题、最小记录和验证步骤。

要解决的问题

几个月后还能复现今天的失败吗?远端技能能否安全接入?预算翻倍是否带来可验证收益?这些问题决定本周调整顺序。

最小抽象

把个人栈分成三个可独立检查的对象:有保留期限的执行证据、有来源与权限边界的技能、带固定预算的评测任务。

工程闭环

  1. 列出追踪样本的用途、保留期限和恢复方式;优先验证一个脱敏失败样本能否重放。
  2. 为技能来源记录版本与审阅状态;只在隔离宿主里验证 MCP Skills 兼容性。
  3. 给评测结果附上模型、harness、环境与预算版本,避免把运行条件变化误判成能力提升。
  4. 对一个可评分的长任务测量三档预算,在有数据后再调整停止策略。

主线判断

先保证证据可恢复,再比较技能接入与预算策略;缺少一致运行条件时,性能变化难以归因。

小样本推演

假设同一任务在三档预算下质量接近,而耗时持续增加,那么应试验更早停止;若质量仍稳定提升,则保留较高预算。这里只给出判断规则,不预设节省比例,也不把少量任务外推到全部工作负载。

直接结论

本期四条信号达到发布门槛,继续保持周更。执行顺序建议是先保住评测证据,再试技能互操作和预算优化。

下一步阅读:先核查 LangSmith 保留策略,再按是否使用 MCP 或自建评测选择下列原始资料。

参考来源

  1. MCP 官方 SEP-2640 合并记录:Skills Extension,合并日期 2026-09-13。
  2. LangSmith Cloud 官方更新日志,September 7–14, 2026,Tracing 条目。
  3. Harbor Adapters and Harbor-Index,首发 2026-09-03,v3 修订 2026-09-10;本文未将修订单独计算为新信号。
  4. When Agents Slow Down: Understanding LLM Agents’ Test-Time Strategies via Elo-per-token Analysis,首发 2026-09-14。