从给建议,到真的查文件
假设你想从一个文件夹里找出本月收到的发票,整理成清单。普通聊天回答可以告诉你怎样找;有文件读取工具的智能体则可以先列目录,读取日期与内容,筛选符合条件的文件,再生成清单。
它读到一张图片发票时,可能需要改用文字识别;发现同一张发票出现两次,还要检查是否重复。每一步得到的新结果,都可能改变下一步做法。最后能否交差,要看实际生成的清单和文件,而不是聊天框里一句“已完成”。
行动之后,要把结果带回判断
- 01明确目标
找出本月发票,形成清单
- 02使用工具
读取、筛选、核对文件
- 03检查结果
有遗漏就继续,满足条件再结束
回到检查环节的是工具实际结果,不是模型自己宣称成功。
像一位会用工具的办事员,但权限来自系统
语言模型可以帮助理解任务和选择动作,工具负责真正搜索、读取或修改,任务状态记录已经做过什么。模型提出“打开文件”,还需要系统提供相应能力;没有访问权限的文件,不会因为AI想看就自动可读。
这个类比不表示它拥有人类判断力或责任身份。它可能选错文件、误解工具结果,也可能在错误方向上连续操作。因此现实系统通常还需要限制可用工具、操作范围和执行次数,重要动作可以交回人确认。
有固定流程,也有边做边决定的流程
如果程序规定“收到表单→生成摘要→发给指定人”,路径主要由开发者预先写好,更像自动工作流。智能体通常有更大空间,根据中途结果选择接下来做什么;实际产品可能混合两种方式,“智能体”的叫法也并不完全统一。