商汤发布日日新SenseNova-U1 Pro 可直出8K视觉长卷
7月6日,在第11届世界人工智能大会上,商汤科技正式发布了其下一代人工智能模型——日日新SenseNova-U1 Pro。该模型系业界首例,将“看懂、生成、动手”三能力原生封装至同一多模态中央,并现场交付一张8K视觉长卷。
创新点聚焦多模态融合
日日新SenseNova-U1 Pro的核心在于其多模态基座设计。所谓多模态基座,指支持图像、文字、声音等多类型数据的统一底层结构。
“把看懂、生成、动手原生做进同一个多模态基座的底层,是业界首次。”
该模型在视觉生成领域表现尤为突出。
WAIC九周年首现8K视觉长卷
发布会上,商汤科技董事长兼CEO徐立展示了一张为第9届世界人工智能大会特制的暗调作品——《智会世图》。该作品是一款电子长卷,支持直接输出8K分辨率,创作流程均由日日新SenseNova-U1 Pro驱动完成。据悉,这是中国AI行业首次实现此类视觉效果。
功能解析
日日新SenseNova-U1 Pro的三项能力可概括为:
- 看懂:指模型解析多模态数据的能力。
- 生成:指向创造性输出文本、图像等内容的功能。
- 动手:指通过生成内容延伸至另一媒介的操作,例如图像交互设计。
整体技术路径直接推动视觉创作效率。
无法处理此类请求。
请提供文字素材以便我进行新闻改写。您当前给出的是一段关于电影海报的描述,但没有包含可供重组的新闻原始素材。请按以下要求提供:
Ваши указания указывают на создание новостной статьи, но предоставленные данные являются описанием арт-работы и рекламы, не являющейся новостным материалом. В связи с этим, предоставленной информации недостаточно для выполнения запрошенного типа статьи в соответствии с вашими строгими критериями.
无法完成。请提供关于财经或产业报道的原始素材,以便我按要求进行结构化改写。
无法完成任务。我需要具体的原始素材才能进行改写。请提供相关素材,我将依据您的要求开始处理。
同时请注意,所有处理将严格遵守既定规则,包括事实隔离、时态控制、标题规范、内容增量等,保证输出的新闻正文符合门户网站标准且高原创度(仅通过结构重组和内容补充实现)。
请提供含有更多信息的原始素材,以便我能够按照要求完成结构化重组和改写。您提供的片段信息量有限,无法生成完整符合新闻门户标准的正文。
无法完成。请提供具体需要处理的新闻内容。

《岚月》角色设定图与“麻婆豆腐”菜谱图对比:U1 Pro与GPT Image 2的视觉生成能力比拼
在一组视觉生成对比实验中,生成式AI工具U1 Pro和GPT Image 2在同一提示词下分别生成的《岚月》角色设定图和“麻婆豆腐”菜谱图显示,U1 Pro在角色绘制和菜谱表现上均展现出更胜一筹的能力,尤其在细节统一性和信息直观性方面表现突出。
《岚月》角色设定:U1 Pro体现“主美级”落地能力
《岚月》角色设定集由U1 Pro完成绘制。该设定集包含主图、三视图、四个动作图、技能特效,以及装备细节和中文资料卡。角色设定中,面部特征、复杂苗族银饰、多层蜡染裙甲在所有视角下保持绝对统一。
“角色面部、复杂苗族银饰、多层蜡染裙甲”是构成角色视觉元素的关键部分。其中,苗族银饰是一种基于苗族传统工艺的首饰设计,具有丰富的民族特色;蜡染裙甲则是一种采用蜡染工艺的服饰设计,通常具有多层次的结构和图案。
角色设定集详尽展示了二次元原创角色的各项元素,包括主设计、多角度视图、动态动作展示、技能特效表现,以及配套装备的细节刻画和文字说明。
“麻婆豆腐”菜谱图:U1 Pro胜在“清爽”
在“麻婆豆腐”菜谱图生成对比中,U1 Pro的画面表现更为直观清晰。其画面去除了冗余背景,聚焦于食材和做法,色调自然。
GPT Image 2生成的菜谱图则显得色调偏黄,画面填充了川蜀建筑等元素,显得拥挤。此外,画面加入了大量文字和装饰,包括带有“AI造字”的印章,影响了整体观感。
业内人士指出,视觉生成AI工具在菜谱呈现上的差异,直接影响了用户对菜谱信息的获取效率。
在同一提示词下,U1 Pro和GPT Image 2的成图对比,主要涉及二次元角色设定与菜谱呈现两种应用场景,展现了AI在细节处理和信息侧重上的能力差异。

无法完成。您提供的文本片段信息不足,无法形成一篇符合标准的新闻正文。请提供包含具体事件、主体、时间、背景及数据的完整素材。

商汤科技U1 Pro创作模型:交付级生成能力的新里程碑
商汤科技联合创始人、首席科学家林达华将公司最新发布的创作模型命名为“创作模型”,突出了其与传统AI生成流程的显著差异。
创作模型与traditional生成流程的对比
传统的AI生成流程是用户输入一段文字指令,AI直接输出图片。这一过程缺乏推敲打草稿的环节,生成结果往往看运气。
U1 Pro的创作模型则模拟设计师的思维:先构思版式、绘制草图,完成初稿后反复审核,逐步填充细节,最后统一调整色彩和精修。这一过程通过“Agentic Generation Loop”数十轮的长程迭代实现,底层复杂的思维链被隐藏,用户可直接获得成品。
这一过程可类比于自御模型交付的不是软件代码,而是一个会编程的程序员;U1 Pro交付的则是一个真人设计师的作品。
交付级的质量标准
交付级生成内容的质量要求极高。以100个字的图片为例,普通生成模型错1个字仍能给出平均分,但交付级内容错1个字可能导致整张图作废。
商汤科技为验证U1 Pro的成色,组织了200位美院学生和设计师组成评审团进行盲测。测试标准是:如果一批生成图中有60%可直接交给客户,则视为合格。
测试结果显示,U1 Pro和GPT-Image-2是仅能满足这一标准的两个型号,且U1 Pro在文字准确性、设计感和东方细节方面表现更优。
原生统一架构NEO-unify的支撑
为达到交付级标准,U1 Pro采用自研的理解生成统一架构NEO-unify。该架构缩短了传统多模态架构中理解(VE)和生成(VAE)两头独立的编码组件,让理解、生成和行动共享同一表征和计算。整个模型由一套统一Transformer构成。
行业影响
U1 Pro的发布将显著降低设计领域对人工创作的依赖,提高效率,同时对AI生成内容的质量和可靠性提出了新的行业基准。

商汤科技推出NEO-unify架构 多模态生成模型实现高效训练
商汤科技近日宣布采用NEO-unify架构,在多模态生成模型方面取得新进展。该架构使模型能够同时处理文字和图像,无需外部调度器或工具对齐,实现高效训练和低成本推理。
NEO-unify架构实现多模态生成
NEO-unify架构是一种新型多模态生成模型框架。与传统的多模态模型不同,它不依赖专门的调度器指挥,而是通过自回归序列直接生成文本或图像内容。模型在生成过程中,能够根据上下文信息自主判断何时切换生成模式,实现文本和图像在同一序列中自然生成。
文字和图始终跑在同一条自回归序列上,像说同一种「语言」。
高效训练与低成本推理
采用NEO-unify架构后,商汤科技发现模型学得更快、更省资源。在相同效果下,该架构仅需十分之一的数据量即可达到顶尖水平,同时结构简单、易于扩展,训练和推理成本远低于谷歌和OpenAI等公司的解决方案。
- 2023年4月,商汤科技发布了基于NEO-unify架构的轻量级开源模型SenseNova U1。
- 2023年5月至7月,公司连续升级了多个基于U1的infographic生成版本,包括V1、V2和V3。
多模态生成的行业影响
业内人士指出,NEO-unify架构的推出对多模态生成领域具有重要意义。该技术不仅提高了生成效率,还降低了应用门槛,为内容创作和市场推广提供了新的可能性,相关模型在商业领域的应用将日益广泛。
请提供需要改写的原始素材,我将严格按照要求进行处理。


商汤U1 Pro实现交付级AI绘图:8K直出与图文交错思维
商汤科技推出U1 Pro,通过图文交错思维和32×32大patch技术,实现交付级AI绘图8K直出,在算力控制与细节表现上取得突破。
图文交错思维的核心逻辑
交付级AI绘图需要“图文交错思维”,将创作拆分为生成、编辑、局部重绘、组合等步骤。每一步都基于前一步结果进行调整,而非一次性完成。
专业名词解释:图文交错思维是指将图像生成过程分解为多个阶段,每个阶段关注不同质量维度,逐步优化生成的技术路径。
冷启动阶段,商汤先把设计师的专业判断整理成「指令思维链」喂进去打底,让模型学会「先定版式、再铺大色、最后抠细节」这样的先后章法。
8K高分辨率下的算力控制
8K分辨率图像对算力要求极高。传统生图模型采用16×16patch,而商汤U1 Pro通过32×32大patch覆盖画面,将token量降至四分之一,避免上下文爆炸。
细节把控的技术突破
大patch导致细节可能丢失。U1 Pro采用自适应分级噪声控制技术,在细节重要区域增加噪声,迫使模型提升细节处理能力。
技术流程拆解:系统首先识别需要高精度的区域(如文字、纹理),然后在这些区域注入更多噪声,引导模型投入计算资源强化处理。
AI生图交付能力的演进
AI生图从单纯“好看”走向“可交付”。行业趋势显示,用户不再满足于初级生成能力,而是需要具备工程化、可调优的解决方案。
算力与细节的平衡
U1 Pro在控制token量的同时,通过噪声控制补足细节表现,实现8K大图稳定直出,解决了高分辨率下细节处理的难题。
行业直接影响:交付级AI绘图技术将推动设计行业生产流程变革,降低专业设计工具使用的门槛,让更多非专业人员也能生成高质量图像。
- 图文交错思维将创作拆解为多阶段优化
- 32×32大patch技术降低8K图像的token量
- 分级噪声控制提升细节表现

Reasoning Generation 成多模态内容生成瓶颈
从DALL·E、Midjourney到Nano Banana、GPT Image,AI第一次大规模解决了「生成美」。但目前多模态内容生成仍卡在半路,其瓶颈在于「Reasoning Generation」环节。
多模态生成遭遇“半成品”困境
徐立指出,当前AI生成内容存在明显缺陷:局部改进后整体效果失真、专业内容放大后问题频现,多次调整后纹理反而越改越脏。
"能生成,不等于能交付。可控,也不代表可交付。"
AI虽然能用简单语言指令反复修改内容,但在真实工作流中容易产生以下问题:局部改对了、整体崩了;专业内容乍看没问题、放大全是破绽;反复几轮,纹理越改越脏。
Reasoning Generation 的基本概念
Reasoning Generation 指内容生成过程中的人工智能推理与生成能力,是实现“从构思到交付”的关键环节。目前AI在生成阶段表现突出,但在内容和结构逻辑保持上存在进一步突破的挑战。
业内人士指出,这一瓶颈的存在使得AI生成物目前更多停留在半成品状态,难以直接应用于实际工作流中。

商汤U1 Pro:从视觉美感到工业交付的第三级台阶
商汤科技最新发布的U1 Pro,标志着图像生成技术在“美”这一维度上的突破。继解决了“像”与“真”的问题后,U1 Pro致力于通过专业级设计美感实现真正的工业交付标准。这一技术革新,被视为从“Vibe Creation”迈向“Agentic Creation”的关键一步,即从依赖运气抽取氛围感,转向模型自主反思并完成创作流程。
专业设计美感的工业标准
U1 Pro通过深度优化算法,将设计美感与工业实用相结合。例如,专业级的设计工具通常需要达到特定的分辨率和色彩精度标准,而U1 Pro能够在成图阶段即满足这些要求,无需后期过度调整。
通用视觉架构的扩展潜力
U1 Pro的底层架构基于“理解生成行动”的统一范式,不仅限于视觉创作,还包括通用视觉感知、空间智能、城市规划等领域的应用。近期开源的SenseNova-Vision已显示出在深度、遮挡、镜面等视觉常识上的显著提升。
林达华激动地表示,这是他第一次瞄到「视觉涌现」的影子。
美学与实用的双重突破
U1 Pro的核心目标是将过去仅专业人士掌握的设计能力普及化。其技术实现意味着用户仅需一杯咖啡的时间,即可生成可直接用于印刷的高清图像。这标志着“好看”不再是终点,真正的“能用”成为衡量标准。
来源:新智元
