• 最近访问:
发表于 2024-12-04 17:44:01 股吧网页版
腾讯混元发布视频生成大模型 并宣布开源
来源:广州日报 作者:文静

K图 00700_0]

  12月3日,腾讯混元大模型公布最新进展:正式上线视频生成能力,这是继文生文、文生图、3D生成之后新一轮的迭代。同时,腾讯宣布开源该视频生成大模型,参数量130亿,是当前最大的视频开源模型。

  “用户只需要输入一段描述,即可生成视频,”腾讯混元相关负责人透露,目前的生成视频支持中英文双语输入、多种视频尺寸以及多种视频清晰度。目前该模型已上线腾讯元宝App,用户可在AI应用中的“AI视频”板块申请试用。企业客户通过腾讯云提供服务接入,目前API同步开放内测申请。

  然而,在视频生成“赛道”,腾讯大模型并非做得最早的,有国内视频生成模型已开始商业化“落地”。为此,腾讯混元的多模态生成技术负责人凯撒在接受全媒体记者采访时表示,“我们确实看到很多产品和模型有先发优势。但是我们做视频生成模型时发现,现在视频生成特别是文生视频领域,成熟度远没有外界想象得那么高。”他指出,腾讯看来目前该技术还没能达到大规模商业化的程度,仍属于技术打磨阶段。当下,腾讯推出视频生成模型,并且选择开源是希望跟社区一起把技术早日推向图像生成等这种真正可用的状态。

  “开源对于大模型厂商来说,并不是坏事,对于独立开发者和社区而言,更是‘一加一大于二’。”凯撒说道。据了解,除了视频生成外,基于混元视频生成的生态模型之下,会有视频配音模型、2D数字人驱动等。

  在人物、人造场所等场景下表现出色

  根据与国内外多个顶尖模型的评测对比显示,混元视频生成模型在文本视频一致性、运动质量和画面质量多个维度效果“跑出”,在人物、人造场所等场景下表现尤为出色。

  据了解,腾讯混元生成视频大模型可以实现超写实画质、生成高度符合提示词的视频画面,画面流畅不易变形。比如,在冲浪、跳舞等大幅度运动画面的生成中,腾讯混元可以生成非常流畅、合理的运动镜头,物体不易出现变形;光影反射基本符合物理规律,在镜面或者照镜子场景中,可以做到镜面内外动作一致。同时,模型还可以实现在画面主角保持不变的情况下自动切镜头,这是业界大部分模型所不具备的能力。

  (由腾讯混元视频生成的视频截图)

  腾讯方面表示,混元的技术创新在于,它基于跟Sora类似的DiT架构,并在架构设计上进行多处升级。混元视频生成模型适配了新一代文本编码器提升语义遵循,其具备强大的语义跟随能力,更好地应对多个主体描绘,实现更加细致的指令和画面呈现;采用统一的全注意力机制,使得每帧视频的衔接更为流畅,并能实现主体一致的多视角镜头切换;通过先进的图像视频混合VAE(3D 变分编码器),让模型在细节表现有明显提升,特别是小人脸、高速镜头等场景。

  目前,腾讯宣布开源该视频生成大模型已在Hugging Face平台及Github上发布,包含模型权重、推理代码、模型算法等完整模型,可供企业与个人开发者免费使用和开发生态插件。基于腾讯混元的开源模型,开发者及企业无须从头训练,即可直接用于推理,并可基于腾讯混元系列打造专属应用及服务,能够节约大量人力及算力,加速行业创新步伐。

  从年初以来,腾讯混元系列模型的开源速度不断加快。此前,腾讯混元已经开源了旗下文生文、文生图和3D生成大模型。至此,腾讯混元系列大模型已实现全面开源。

郑重声明:用户在财富号/股吧/博客等社区发表的所有信息(包括但不限于文字、视频、音频、数据及图表)仅代表个人观点,与本网站立场无关,不对您构成任何投资建议,据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容,远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息,谨防上当受骗!
作者:您目前是匿名发表   登录 | 5秒注册 作者:,欢迎留言 退出发表新主题
郑重声明:用户在社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。《东方财富社区管理规定》

扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-34289898 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:021-54509966/952500