
超长会话统计画像
编写于 2026-08-13
有些 Peri 会话只回答一个问题,有些会连续运行数小时。后者不是把普通对话简单拉长,它们包含更密集的工具调用、更多子代理,也更依赖上下文压缩和反复验证。
本研究把消息数不少于 500 的主会话定义为超长会话。在冻结快照中,共有 42 个超长会话和 3,168 个基准会话。研究问题是,这些会话中的工具使用、压缩、子代理和收尾形态怎样共同出现。
数据底稿与公开边界
数据快照冻结于 2026-08-09,覆盖 2026-06-06 至 2026-08-09 的主会话。分析以会话为主要单位,工具密度按每 100 条消息归一化。文章只使用既有聚合底稿与静态分析产物,不重新读取运行数据库,也不发布会话标识、标题、路径、原始消息、极值个案或小于 10 个样本的交叉分组。分析脚本可审计,但原始数据因隐私不公开,因此第三方不能精确复现这些结果。
长会话的工具密度更高
42 个超长会话中,工具调用的会话中位数为 255.5 次,每 100 条消息的工具调用中位数为 47 次。基准会话对应的工具密度中位数为 25 次。用户消息在超长会话中占 4.3%,assistant 与工具消息合计超过九成。这一构成说明长任务主要由推理、执行与结果返回推进,用户更常在关键节点补充方向,而不是逐步指挥每一次操作。
工具密度不能直接当作效率指标。大量调用可能来自完整的测试闭环,也可能来自重复读取、失败重试或搜索。判断健康度仍需结合任务进展与错误形态。
上下文压缩控制最终可见规模
冻结快照中,无 compact 痕迹的长会话有 23 个,有 compact 痕迹的长会话有 19 个。两组最终可见上下文的中位数分别为 1,130 KB 与 318 KB。这是跨时期的组间差异,不是随机对照实验。早期组与后期组还可能同时受到模型、工具集和任务类型变化影响,因此 72% 的中位数字节差只能称为观察差异,不能称为 compact 单独带来的节省率。
更可靠的机制结论是,compact 让历史消息的可见规模不再随会话长度单调增长。它为长任务保留继续运行的空间,但摘要是否保住关键约束,仍需用任务结果和后续行为验证。工程机制见Agent Loop,用户操作见上下文工程。
子代理记录受到压缩影响
超长会话关联 308 个子代理线程,父会话中仍可见的 Agent 派发记录只有 203 次。两种口径相差 105 次,占完整子线程计数的 34%。差异说明一个研究陷阱。只统计当前可见消息,会系统性低估被 compact 隐去的后期派发。涉及派发频率时,子线程关系比可见工具调用更接近完整口径。
在 308 个子代理中,95.1% 记录为 done,其余低频终态合并占 4.9%。这些是线程状态,不等同于主任务成功率。子代理完成也可能只代表一个局部探索结束。
失败信号增多但绝对密度低
超长会话中的连续失败链为每 100 条消息 0.39 次,基准组为 0.15 次。非轮询工具的同参数重复调用分别为 0.13 次和 0.03 次。
相对倍数看起来明显,绝对密度仍然很低。启发式规则也会把正常轮询、搜索和迭代误判为问题,因此底稿先排除了后台结果轮询与典型读搜交替,再计算上述指标。
这类信号适合作为待检查样本的筛选器,不适合直接给一次会话判定质量。Peri 已有的工具行为研究也采用同样边界,把时序吻合和因果证明分开处理,见工具行为修复证据。
结尾形态不代表任务成功
超长会话的结尾集中在 assistant 文本与非错误工具结果,没有形成足够大的失败结尾分组可供公开比较。这个分布不能称为成功率。达到 500 条消息的会话已经经过强烈的幸存者筛选,短时间失败、被放弃或无法开始的任务不会进入样本。文本结尾也只能说明最后一条消息类型,不能证明交付通过验收。
研究边界限制因果解释
消息级精确时间线不可得,字节不是 token,compact 两组跨时期,缺陷识别依赖启发式,原始数据也不能公开。这些边界让研究能够描述长会话的共同形态,却不能分离某个机制的独立效果。后续研究若要回答因果问题,需要公开可审计的实验样本或前瞻性对照设计。
回到开头那些持续数小时的会话,消息多并不是它们唯一的特征。真正区分长任务的,是工具循环不断推进、上下文没有无限膨胀、子代理在不同阶段加入,以及每个阶段还能留下可检查的验证证据。
继续阅读 工具 token 消耗研究 和 RCRA 的中断恢复逻辑。