菜单在图片里,要求在文字里

假设小林拍下一张菜单,问:“帮我找出标价不超过30元的面食。”系统需要从照片中辨认菜名、价格和对应位置,再把“面食”“30元以内”这些文字条件结合起来,才能给出答案。

如果价格一栏反光,看不清的是28还是38,图片输入再丰富,也不能把缺失细节变成确定事实。合适的回答应保留看不清的部分;直接猜成28元,会把识别不确定性藏起来。

一眼看懂 / 示意图

照片与文字,各提供一部分信息

两路输入共同筛选,价格模糊的一项保持不确定菜单照片+文字条件,共同决定筛选结果照片中的可见内容牛肉面 28元炒饭  22元海鲜面 ?8元(反光)你提出的问题找出不超过30元的面食文字给出筛选目标牛肉面:符合;炒饭:不是面食海鲜面:价格不清楚,不能确认这张菜单为原创示意,不是实际商家或模型测试截图。
  1. 01菜单照片

    菜名、价格及它们的对应位置

  2. 02文字问题

    面食,价格不超过30元

  3. 03结合后的回答

    按条件筛选,并标出无法确认的项目

图中的答案依赖两路输入;反光或模糊处仍可能无法识别。

不只是把不同文件装进一个上传框

文字、图像、声音可以提供互补线索:看路口照片时,画面说明位置关系,用户的问题说明想找什么;处理视频时,还可能结合声音与画面随时间的变化。

但一个产品能接收PDF,并不一定意味着模型完整看过每页版面:有的流程只抽取文字,有的会分析页面图像。是否处理了图片、音频或布局,要看实际输入能力和应用如何传递材料。

看懂几种输入,与生成几种输出不同

某个模型能读图并用文字回答,不表示它也能生成图片;能处理声音,也不保证支持视频。多模态描述跨信息形式的能力,生成式AI描述产生内容的任务,两者可以交叉,却不是同义词。