你可能会说
这个 AI 功能涉及到多模态,帮我理解一下然后集成进去。
AI 不只懂文字,还能看图、听音频、生成图片/视频。
AI 不只懂文字,还能看图、听音频、生成图片/视频。能处理多种「模态」(类型)的信息。
生活类比
像一个既会看图纸、又会听描述、还能画草图的全能设计师。
🎮 动手试试
关于「多模态」,以下哪个描述最准确?
你可以这样告诉 AI
帮我看看这张设计稿截图有哪些 UI 问题——按钮间距、颜色对比度、字号层级,逐条列出来并给出修改建议。
多模态是模型能同时「接收」多种输入(图文音),跨模态是从一种模态「转换」到另一种(如文字生图)。前者是输入能力,后者是转换能力。
图片识别与分析
让 AI 识别截图中的 UI 问题、从照片提取文字、分析图表数据时,必须用多模态模型。
和 AI 协作时
截一张报错页面发给 AI,说「看图帮我分析为什么报这个错,怎么修」,AI 能直接读图给出方案。
纯文本处理
做文本摘要、翻译、代码生成等只涉及文字的任务,用纯文本模型更快更省钱。
无视觉或音频输入需求
后台管理系统、API 服务、数据处理脚本等不涉及图像音频的项目,多模态能力完全用不上。
AI 不只懂文字,还能看图、听音频、生成图片/视频。能处理多种「模态」(类型)的信息。
像一个既会看图纸、又会听描述、还能画草图的全能设计师。
你发张截图让 AI 分析,用的就是多模态能力。