大语言模型中的长程状态跟踪:通过深度依赖工具调用链执行MD5

大语言模型中的长程状态跟踪:通过深度依赖工具调用链执行MD5

云队友AI ·

大型语言模型(LLM)的常见评测大多聚焦单步推理或短程交互,但真实任务往往需要连续执行多个相互依赖的步骤。这种长程状态跟踪能力极少被单独考察,因为每一步都建立在前一步结果之上,单点小错会随链路延长而不断放大,最终导致整体失败。为检验这一能力,研究团队设计了一个极具挑战性的场景:让模型通过一串深度依赖的工具调用来完成MD5哈希计算。MD5内部包含多轮状态更新与位操作,每个中间值都必须精确传递,容不得半点偏差。这项工作值得关注,在于它将评测重心从“一步答对”推向“长链条操作中能否稳定保持状态”。如果LLM能胜任此类任务,意味着它们更有潜力承担编程代理、多步工具使用等真实应用;反之,则说明还需开发更有效的记忆与状态管理机制。对长程依赖的系统评测,有望成为衡量大模型实用性的重要标尺。

本文来源:arXiv cs.AI

阅读原文 ↗
分享