导航首页 » AI 快讯 » 多模态成为标配:文本、图像、音频、视频一体化
多模态成为标配:文本、图像、音频、视频一体化

一年前「支持多模态」还是卖点,现在已经是入场券:主流大模型都能看图、听声音、读文档,甚至直接生成视频。

多模态能做什么

  • 看图:截图问答、发票识别、图表读数据、UI 走查。
  • 听声:会议录音转写、说话人区分、情绪与关键词提取。
  • 看视频:把视频总结成文字大纲,或按时间点检索内容。
  • 生成:文生图、图生视频、文生音频,一条链路走完。

对普通用户最实用的三件事

  1. 用截图提问——比打字描述快得多,尤其是报错信息、表格、设计稿。
  2. 会议录音直接丢给 AI 出纪要,配合通义听悟、讯飞听见这类工具。
  3. 图片里的文字要复制:直接让多模态模型读出来,比 OCR 工具顺手。

注意

多模态的「看」并不等于「看懂」:图中数字、密集表格、专业图表仍可能看错。涉及金额、比例这类关键数据,务必人工复核。

本文为编辑整理,功能覆盖情况请以各产品官网为准。