158 6721 8818

0574-27676908

新闻动态

新闻动态

谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1,打破计算机视觉桎梏

作者:宁波海曙光信电子科技有限公司 浏览: 发表时间:2026-07-21 15:27:27

谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1,打破计算机视觉桎梏

 来源:IT之家 

IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。

IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。

A single model generates depth, normals, segmentations, and pose from the same video based on a text prompt. Despite training mostly on synthetic data, it generalizes to real-world footage and object classes it never saw.

但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。

谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎

GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。

GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。

Architecture diagram of GenCeption showing how an input video and text prompt flow through VAE and text encoders into a pre-trained DiT that produces dense task outputs as RGB video and sparse task outputs via learnable tokens and an MLP, all in a single forward pass.

训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。

泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。

Left, a radar chart comparing GenCeption as both specialist and generalist against models like DepthAnything3, SAM3, D4RT, and VGGT-Ω across ten vision tasks. Right, a log-scale plot of depth accuracy (AbsRel) versus number of training frames.

性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。

Six rows showing original video frames alongside color-coded depth maps and surface normal maps for scenes including a robot arm, electronics store, workshop, warehouse, nighttime street, and interior with a hand in the foreground.


谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1,打破计算机视觉桎梏
谷歌 DeepMind 推出 GenCeption 模型,依托阿里 Wan2.1 视频模型改造优化,把预训练视频生成能力应用于深度估计、图像分割等视觉任务,仅少量视频数据微调即可实现多类视觉检测输出。
长按图片保存/分享
0

相关新闻

产品中心

产品中心

快速导航

联系我们

手机:158 6721 8818(微信)

电话:0574-27676908

地址:海曙区东渡路29号8楼D01

版权所有© 2025 宁波海曙光信电子科技有限公司   浙ICP备14008261号 

版权所有© 2025 宁波海曙光信电子科技有限公司   浙ICP备14008261号 

客服中心
手机号
158 6721 8818(微信)
服务热线
0574-27676908
上班时间
周一到周五
E-mail地址
9090683@qq.com
添加微信好友,详细了解产品
使用企业微信
“扫一扫”加入群聊
复制成功!
添加微信好友,详细了解产品
我知道了