从给建议,到真的查文件

假设你想从一个文件夹里找出本月收到的发票,整理成清单。普通聊天回答可以告诉你怎样找;有文件读取工具的智能体则可以先列目录,读取日期与内容,筛选符合条件的文件,再生成清单。

它读到一张图片发票时,可能需要改用文字识别;发现同一张发票出现两次,还要检查是否重复。每一步得到的新结果,都可能改变下一步做法。最后能否交差,要看实际生成的清单和文件,而不是聊天框里一句“已完成”。

一眼看懂 / 示意图

行动之后,要把结果带回判断

选择动作、调用工具、检查结果形成循环,完成或达到条件后停止智能体:行动有结果,结果再影响下一步选择动作依据目标和当前信息调用工具读取、筛选或整理检查结果核对清单与实际文件仍有遗漏:带着实际结果继续目标满足或达到停止条件权限来自系统;一句“完成了”不能代替真实执行结果。
  1. 01明确目标

    找出本月发票,形成清单

  2. 02使用工具

    读取、筛选、核对文件

  3. 03检查结果

    有遗漏就继续,满足条件再结束

回到检查环节的是工具实际结果,不是模型自己宣称成功。

像一位会用工具的办事员,但权限来自系统

语言模型可以帮助理解任务和选择动作,工具负责真正搜索、读取或修改,任务状态记录已经做过什么。模型提出“打开文件”,还需要系统提供相应能力;没有访问权限的文件,不会因为AI想看就自动可读。

这个类比不表示它拥有人类判断力或责任身份。它可能选错文件、误解工具结果,也可能在错误方向上连续操作。因此现实系统通常还需要限制可用工具、操作范围和执行次数,重要动作可以交回人确认。

有固定流程,也有边做边决定的流程

如果程序规定“收到表单→生成摘要→发给指定人”,路径主要由开发者预先写好,更像自动工作流。智能体通常有更大空间,根据中途结果选择接下来做什么;实际产品可能混合两种方式,“智能体”的叫法也并不完全统一。