视频号
    标题 摘要 内容
    详情

    AI 视觉生成正从 “创意玩票” 走向产业真实交付。但在落地过程中,行业长期面临两大痛点:一是面对大段、多约束的复杂创作指令,模型容易遗漏细节、逻辑跑偏;二是高分辨率生成往往只是简单放大画布,全局构图崩坏、细节糊化,很难产出可直接使用的高清成品。


    商汤科技正式开源SenseNova U1.5 Lite 正式版。这款基于自研 NEO‑Unify 原生统一架构打造的 8B‑MoT 轻量级多模态模型,完成系统性能力升级:原生支持 3‑4K 字符超长指令遵循,解锁原生 4K 真实视觉创作流,把视觉理解、推理、生成、编辑收拢在一套模型之内,推动 AI 视觉创作迈入稳定可用的产业新阶段。


    打破两大行业痛点:长指令可控 + 原生 4K 真实创作


    多数开源视觉模型,面对超过 1000 字符的复杂提示词,极易出现主体丢失、约束遗漏、逻辑错乱,很难同时兼顾主体、数量、空间关系、文字、版式、风格多重创作条件,复杂设计任务只能拆分成多轮反复调试,效率低下。

    同时,市面上不少高分辨率方案依赖后期超分放大,并非原生生成。放大之后全局结构溃散、光影失真、微小文字错乱,看似分辨率很高,却无法直接用于海报、信息图、商业物料等真实生产场景。


    SenseNova U1.5 Lite 正式版针对性破解上述难题:

     ✅ 原生 3‑4K 超长指令遵循原生支持 3‑4K 字符上下文输入,从容承接大段结构化创作需求,可同时解析主体位置、元素数量、空间逻辑、中英文文字、排版布局、材质光影等多重约束,大幅降低复杂视觉任务的调试成本,长 Prompt 下依旧稳定输出,减少细节丢失与逻辑跑偏。

    原生 4K 真实视觉创作流并非后期插值放大,实现原生 4K 图像生成。在高分辨率画幅下,兼顾全局构图完整性与微观细节表现力,物体肌理、材质质感、光影折射、小号文字信息均可清晰呈现,生成结果可直接用于商业设计、信息图表、宣传物料等场景,打通从 AI 生成到成品交付的链路。


    六大核心能力,覆盖完整视觉生产链路


    依托 NEO‑Unify 原生统一架构,模型不拆分编码器、VAE 组件,语言语义与像素生成在同一套表征空间完成计算,一站式完成理解、生成、编辑全流程,正式版带来全方位能力强化:

    1. 高质量真实感视觉生成

      优化构图、色彩、材质、光影表现,改善 “局部细节好看,整体画面割裂” 的通病,提升人像、实物、环境场景的真实度,输出更贴近实拍质感的视觉内容。
    2. 高可靠原生图像编辑能力

      强化主体身份、空间结构、版式信息以及非编辑区域的保留能力。支持局部修改、元素替换、文字精修、多参考图联动编辑,修改画面时不会破坏原有整体结构,适合迭代式创作调整今日头条。
    3. 复杂文字与版式生成能力

      大幅提升中英文文字生成质量,擅长海报、信息图、品牌长图等高信息密度内容创作,不只生成画面,更可以组织完整视觉版式,满足图表、演示物料、宣传海报生产需求。
    4. 精细化区域可控编辑

      支持 Bounding Box 框选、Visual Marker 标记、单图 / 多参考图输入等多种控制手段,精准限定修改范围,实现 “指定区域改动,其余画面保持不变”,可控性大幅提升。
    5. 轻量高效,部署门槛更低

      8B‑MoT 轻量化模型规格,兼顾强悍生成能力与推理效率,适配本地部署、私有化部署、行业嵌入等多元场景,降低企业与开发者接入高清多模态视觉能力的算力门槛。
    6. 统一多模态闭环

      一套模型同时完成看图理解、指令推理、图像生成、局部编辑,不需要多个模型串联调用,减少链路损耗,为 AI 智能体、GUI 视觉 Agent 提供强大的视觉底层底座。


    多元落地场景,赋能创作者与产业开发者


    SenseNova U1.5 Lite 正式版面向创作者、企业设计师、AI 开发者、行业集成商开放,落地场景十分丰富:

    • 商业内容创作

      :海报、宣传长图、杂志封面、营销物料,原生 4K 直出,缩短设计周期;
    • 信息可视化

      :信息图表、技术示意图、流程长图,支持高密度文字与复杂版式;
    • 迭代式创意设计

      :多轮编辑、局部微调、参考图融合,快速完成方案迭代;
    • 开发者与科研

      :本地私有化部署,用于多模态应用、视觉 Agent、具身智能相关二次开发;
    • 行业解决方案

      :文创、教育、数字营销、工业可视化等行业,构建 AI 视觉生产工具链。

    值得一提,模型现已面向全球开源,开发者可直接获取权重进行部署与二次开发,快速搭建属于自己的 4K AI 视觉工作流。