AI 提效
第 6 课:图像生成与多模态 AI
分清文生图、图生图、图像编辑与多模态理解,认识视觉生成的实用边界。
这一节要解决什么问题
文生图以文字描述生成画面;图生图以参考图控制构图或风格;图像编辑则在指定区域添加、删除、扩展或调整。它们都不是“把脑中的画面准确打印出来”:构图、文字、手部、物理关系和品牌细节仍可能出错。
多模态意味着什么
多模态模型能接收或输出不止一种信息形式,例如看图回答问题、根据表格写说明、用语音进行对话。它的意义是让任务更贴近日常资料,而不是保证它真正理解场景。上传一张发票让工具提取字段,可以提高录入效率;付款前仍应核对原件。
一个负责任的视觉工作流
先明确用途:概念草图、内部配图还是正式广告。其次提供你有权使用的参考材料,并写明主体、场景、用途和不应出现的元素。最后检查人物身份、商标、文字、事实暗示和授权。生成一张“实验室照片”不应被标注为真实现场;生成他人肖像更不应绕过同意。
本节小结
图像生成降低了视觉试错成本,多模态降低了资料转换门槛;两者都没有取消真实性、肖像、商标和版权审查。