菜单在图片里,要求在文字里
假设小林拍下一张菜单,问:“帮我找出标价不超过30元的面食。”系统需要从照片中辨认菜名、价格和对应位置,再把“面食”“30元以内”这些文字条件结合起来,才能给出答案。
如果价格一栏反光,看不清的是28还是38,图片输入再丰富,也不能把缺失细节变成确定事实。合适的回答应保留看不清的部分;直接猜成28元,会把识别不确定性藏起来。
照片与文字,各提供一部分信息
- 01菜单照片
菜名、价格及它们的对应位置
- 02文字问题
面食,价格不超过30元
- 03结合后的回答
按条件筛选,并标出无法确认的项目
图中的答案依赖两路输入;反光或模糊处仍可能无法识别。
不只是把不同文件装进一个上传框
文字、图像、声音可以提供互补线索:看路口照片时,画面说明位置关系,用户的问题说明想找什么;处理视频时,还可能结合声音与画面随时间的变化。
但一个产品能接收PDF,并不一定意味着模型完整看过每页版面:有的流程只抽取文字,有的会分析页面图像。是否处理了图片、音频或布局,要看实际输入能力和应用如何传递材料。
看懂几种输入,与生成几种输出不同
某个模型能读图并用文字回答,不表示它也能生成图片;能处理声音,也不保证支持视频。多模态描述跨信息形式的能力,生成式AI描述产生内容的任务,两者可以交叉,却不是同义词。