语音助手正在解释一个方案,你说了一句“对,就按第二种”。它应该停下来等你说完,继续原来的介绍,还是直接围绕第二种方案往下讲?如果它已经在内部生成了五条建议,扬声器却只播完两条,此时再问“刚才说到哪了”,它又该以哪份历史为准?

这两个小问题概括了近期语音全双工研究的变化:同时听说只是运行条件,真正困难的是在不断变化的对话中选择动作,并让动作对应用户实际经历的过程。

本文整理 2026 年 7 月 28 日至 9 月 28 日首次提交的 21 篇核心论文,沿着数据、模型与运行时、评测三条线展开。先给出可检索的论文地图,再讨论各条路线解决了什么、证据到哪里为止,以及怎样组成一套实际可用的验证流程。

Read more »

助手正在播报导航,车窗外有风声,副驾在聊天,你轻声说了一句“等一下”。系统应该忽略风声和副驾,及时听见你,又不能被扬声器里自己的声音打断。

这个场景把 VAD(Voice Activity Detection,语音活动检测)的三个问题同时摆在面前:噪声里有没有语音,语音是不是目标用户发出的,以及这次发声是否值得让助手停下来。 只把 VAD 当成静音切分器,很难解释为什么安静房间里的演示很好,真实全双工交互却频繁误停或漏接。

本文以截至 2026 年 9 月 28 日可核实的公开资料为界,重点整理 2025–2026 年的研究,并回顾必要的早期工作。结论先说:新的方向是让检测具备噪声鲁棒性、说话人条件和可测量的响应速度,再把活动信号交给对话策略。

Read more »

本期观察窗口为 9 月 16–26 日。三个公开更新都指向同一件事:工具调用、暂停恢复和 MCP 会话不能只看“跑通”,还要让身份、参数和状态能被准确绑定。个人 Agent 栈本周优先检查审批对象、恢复路径和远端技能包的来源。

Read more »

过去两周,语音大模型最值得关注的变化不是音色又自然了一点,而是语音交互系统开始形成新的架构共识:延迟敏感的前台模型持续听、说和维持对话,耗时更长的推理、检索与工具调用转到后台异步执行,再把结果安全地合并回当前会话。

这意味着语音 Agent 的竞争单位正在从单个模型升级为一套实时系统:媒体传输、连续感知、发言决策、异步任务、打断恢复、状态一致性与权限治理缺一不可。

Read more »

本期观察窗口为 9 月 2–16 日,收录四条公开信号:Skills 的协议分发、追踪数据保留期限、统一评测环境,以及长任务的边际收益。个人 Agent 栈本周最值得做的是检查证据能保存多久、技能从哪里来、追加预算是否仍然有效。

Read more »

过去一个月,语音大模型最重要的变化不是合成声音又自然了一点,而是产品边界正在分叉:一条路线用专用 ASR 强化时间戳、说话人、热词和流式稳定性;另一条路线让原生语音模型持续监听、生成、插话和调用工具。两者解决的问题不同,不应该被一个“语音模型总分”混在一起比较。

Read more »

过去一周主要信号集中在“可控的工具权限扩展”“可执行的评测信号扩展”和“Agent 运行过程的可恢复性”。海外生态继续推进 MCP 与网关治理,国内头部 Agent 则在独立复核、会话续跑、跨端接管和企业用量治理上给出了更贴近本地开发环境的实现。对个人栈来说,重点不是按厂商堆工具,而是用同一套任务和安全指标比较不同 Agent。

Read more »

过去一周信号集中在“可治理的 MCP 访问”“可观测到可回放的 agent 运行闭环”以及“可执行 benchmark 的可用性”上。对个人栈而言,这一周的共识是:与其再加新功能,不如先把编排、治理和评测的可控性补齐。

Read more »
0%