商汤科技今日宣布,轻量级原生统一多模态大模型正式版面向全球开源。相较此前的预览版本,新模型进一步面向真实视觉创作流程进行优化,重点提升复杂指令理解、文字与布局生成、原生四千分辨率图像创作、图像编辑以及精细视觉控制等能力。
从展示效果转向创作流程交付
在生成式人工智能视觉应用中,画面是否美观、是否具有较强的写实感,一直是衡量模型能力的重要维度。不过,对于设计师、内容创作者和开发者而言,模型能否稳定完成一项完整任务,同样决定了其实际使用价值。
在具体创作过程中,用户通常需要同时描述画面主体、构图关系、视觉风格、光影效果、文字内容以及局部细节。生成结果不仅要符合整体要求,还要尽量减少无关区域的变化。若模型无法准确理解较长指令,或者在局部编辑时影响背景、人物等其他内容,用户就需要反复调整提示词,甚至重新进行后期处理。
商汤表示,此次发布的正式版延续了预览版本的原生统一多模态能力,并将重点放在真实视觉任务中的准确性和稳定性上。围绕这一目标,模型对训练数据、任务设计和后训练流程进行了重新完善,希望在视觉质量、可控性、清晰度和使用成本之间提供更适合实际创作的方案。
支持三千至四千字符超长指令
复杂提示词的理解能力,是视觉生成工具落地时经常遇到的瓶颈。过去,用户在输入较长的创作要求时,可能需要主动压缩描述,删减部分约束条件,以避免模型遗漏关键信息。这种方式虽然能够降低指令复杂度,但也可能使最终图像偏离原本的创作意图。
据介绍,正式版支持三千至四千字符的超长复杂指令遵循能力。用户可以在一次指令中提供更完整的场景设定和细节要求,包括主体关系、画面结构、风格方向以及需要重点控制的局部内容。模型对多层次要求的解析能力提升后,有望减少因指令截断、信息遗漏造成的重复修改。
加强文字、布局与图像编辑
文字生成和元素布局也是视觉创作中的重要环节。海报、封面、宣传物料等内容往往同时包含主体图像与文字信息,既要求文字内容准确,也要求其位置、比例和整体构图保持协调。商汤此次将文字与布局能力列为正式版的强化方向,面向包含多种视觉元素的创作任务进行优化。
在图像编辑方面,模型进一步强化了局部修改和精细控制能力。对于替换物体、调整局部细节等需求,理想的编辑结果应当尽量只改变指定区域,并保留背景、人物及其他无关元素。商汤称,新版本针对这一类使用场景进行了改进,旨在降低编辑过程中的连带变化,减少后续返工。
原生四千分辨率提升输出空间
正式版还强化了原生四千分辨率图像创作能力。更高分辨率能够为细节表现、画面放大和后续使用提供更大的空间,尤其适用于对清晰度和画面信息量有较高要求的视觉任务。与依赖后期放大的处理方式相比,原生高分辨率生成更强调模型在创作阶段对整体结构和细节的统一处理。
从此次更新可以看出,商汤正在将轻量级多模态模型的能力重点从单纯展示视觉效果,延伸到复杂指令执行、可控编辑和高分辨率交付等环节。随着正式版面向全球开源,开发者和创作者可围绕视觉内容生产、图像处理及相关应用进行进一步探索。