English
联系我们
网站地图
邮箱
旧版回顾



梦想改造家

谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

读心神探

A |     IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。    

据俄罗斯卫星通讯社和《耶路撒冷邮报》报道,当地时间12日晚至13日凌晨,阿塞拜疆和亚美尼亚边境发生冲突,双方互相指责对方挑起冲突。         IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。外媒:阿塞拜疆与亚美尼亚已达成停火协议当地时间13日,阿塞拜疆卫星通讯社援引消息人士的话称,亚美尼亚和阿塞拜疆已达成当天9时15分开始停火的协议。另据阿塞拜疆Trend通讯社消息,亚美尼亚与阿塞拜疆在当天9时达成停火,但据知情人士透露,停火协议达成后,亚美尼亚武装部队再次违反协议并进行挑衅,随后在9时15分恢复停火。

B |          但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。

C | 亚美尼亚总理帕希尼扬13日表示,该国军队在当天凌晨发生的边境冲突中有49人身亡。         谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。         GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。         GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。 目前阿塞拜疆方面尚未公布伤亡情况。俄罗斯外交部呼吁阿塞拜疆和亚美尼亚严格遵守停火协议当地时间9月13日,俄罗斯外交部发布关于亚美尼亚和阿塞拜疆边境局势的声明。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。声明指出,俄罗斯对亚美尼亚和阿塞拜疆边境局势急剧恶化表示极度关切。俄方呼吁各方执行俄罗斯、阿塞拜疆和亚美尼亚三国领导人于2020年11月9日、2021年1月11日和11月26日达成的三方协议,不要使局势进一步升级,保持克制,严格遵守停火协议。         训练数据以合成为主。声明表示,俄方期待亚美尼亚和阿塞拜疆遵守在俄罗斯联邦的调解下达成的停火协议。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。         泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。         性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。         参考。

D |

Current article:http://ozo9w.zhuankaizhuohangwangdixi.shop/8iciw/20260826/91043.html

Published on:21:52:51



© 1996 - 我的网站 版权所有   联系我们

地址:北京市三里河路52号 邮编:100864