腾讯混元大模型迎来全新升级，文生图功能对外公开

文章主题：腾讯混元大模型,升级,文生图,功能

10月26日，腾讯公司发布声明，其旗下混元大模型进行了全新升级，并正式公开了“文生图”功能，向外界展示了腾讯在图像自动生成领域的卓越实力。经过这次升级，腾讯混元中文模型的表现超过了GPT3.5，且代码能力提升了20%，达到了行业领先水平。

腾讯混元大模型，作为一款实用级通用大模型，其应用场景之广泛令人称奇。如今，已有超过180项腾讯内部业务与腾讯混元紧密集成，涵盖了腾讯会议、腾讯文档、企业微信、腾讯广告以及微信搜一搜等多个领域。此外，近期，QQ浏览器更是基于腾讯混元推出了“PDF阅读助手”，该功能具备智能摘要、智能问答以及多轮提问等多重特点，进一步拓展了腾讯混元在实际应用中的表现力。

在我国，各行各业的客户都在借助腾讯云的混元大模型API，实现智能问答、内容创作、数据分析、代码提示等多元化的应用场景。自今年9月份首批备案通过以来，腾讯混元大模型已经逐步面向C端用户开放，用户只需通过小程序或网页端，便可与腾讯混元进行实时交流。目前，这一技术已广泛应用于零售、教育、金融、医疗、传媒、交通、政务等多个行业，充分展示了其在各领域的实际价值。

在本次场合，腾讯自研的面向特定领域的7B和13B模型初次露面，令人惊喜的是，在达到相同效果的前提下，它们所需的Token数量大大减少，从而使得训练过程更加高效。经过实际测试，这两个模型的表现均优于我国及海外的开源模型，能够在保证性价比的同时，以更快的速度和更高的效率推动应用落地。这将有助于腾讯更好地应对各种垂直场景和业务需求，助力公司全面拥抱大模型时代。

经了解，腾讯拥有从模型算法到机器学习框架以及AI基础设施的自研技术全链路，这为其大模型的迅速迭代提供了有力保障。自从首次亮相以来，腾讯混元大模型便步入了快速升级的阶段。依托于自研算法，模型的稳定性和可靠性得到了稳步提升。

腾讯混元文生图惊艳亮相，广告场景应用效果明显

文生图，作为人工智能领域中的核心科技之一，对于展现通用大模型的实力具有重要的意义，它对于模型算法、训练平台以及算力设施都提出了较高的标准和要求。

腾讯公司是最早开始在广告领域尝试人工智能自动生成图像技术的企业之一,在这个过程中积累了丰富的研发经验和技术实力。据介绍,腾讯混元文生图应用相比其他大型语言模型在人物真实感和场景真实感方面具有明显优势,同时在生成中国风景、动漫游戏等场景方面也表现出色。

在我国业界，腾讯混元在复杂度高的人脸画像生成领域也表现出了出色的能力。举例来说，当输入提示词“生成一张可爱的亚洲4岁女孩穿着棉质连衣裙，大眼睛，古代中国风格，摄影风格为汉服”时，腾讯混元大模型生成的结果让人满意。

可以看到，腾讯混元大模型可以很好地理解提示词中提到的“棉质连衣裙”、“汉服”等内容，同时在风格上，也通过建筑和风景等衬托，很好的展示了“古代中国”的风格要求。

另外一个例子中，输入提示词“ 一个城市CBD办公楼，现代化设计，高层建筑，玻璃幕墙，近景拍摄，摄影风格，摄影照片”，腾讯混元大模型交出了如下作品：

胆小者勿入！五四三二一…恐怖的躲猫猫游戏现在开始！

更简单一些，输入提示词“轻舟已过万重山，水墨画风格”就可以得到下面的图片：

大模型文生图的难点体现在对提示词的语义理解、生成内容的合理性以及生成图片的效果。针对这三个技术难点，腾讯进行了专项的技术研究，提出了一系列原创算法，来保证生成图片的可用性和画质。

在语义理解方面，腾讯混元采用了中英文双语细粒度的模型。模型同时建模中英文实现双语理解，并通过优化算法提升了模型对细节的感知能力与生成效果，有效避免多文化差异下的理解错误。

在内容合理性方面，AI生成人体结构和手部经常容易变形。混元文生图通过增强算法模型的图像二维空间位置感知能力，并将人体骨架和人手结构等先验信息引入到生成过程中，让生成的图像结构更合理，减少错误率。

在画面质感方面，混元文生图基于多模型融合的方法，提升生成质感。经过模型算法的优化之后，混元文生图的人像模型，包含发丝、皱纹等细节的效果提升了30%，场景模型，包含草木、波纹等细节的效果提升了25%。

从秘书起步，十年内无人超越，以一己之力力挽狂澜成就一段传奇

prompt：生成一幅照片：桂林漓江的山水，江上有一艘小船

作为“从实践中来，到实践中去”的大模型，腾讯混元文生图能力，目前已经被用于素材创作、商品合成、游戏出图等多项业务中，此外在广告业务下的多轮测评中，腾讯混元文生图的案例优秀率和广告主采纳率分别达到86%和26%，均高于同类模型。

代码能力行业领先，腾讯内部已经用大模型“写”代码

过去一个月，腾讯混元大模型不仅各项能力均有升级，代码、数学能力也大幅提升。经过对32种主流语言代码文件、各类计算机书籍和博客的学习增训，腾讯混元代码处理水平提升超过20%，代码处理效果胜出ChatGPT 6.34%，在HumanEval公开测试集指标上全面超过Starcoder、Codellama等业界头部开源代码大模型。

只需输入简单的指令如“帮我用前端语言实现一个贪吃蛇”，腾讯混元便能自动生成可运行的代码，快速制作出一个贪吃蛇小游戏。此外，腾讯混元还支持Python、C++、Java、Javascript等多种语言的指令生成，比如输入“用Python画红色的心形线”，腾讯混元会提供代码库选择、安装命令、绘制代码等具体操作步骤的指引。

Prompt：用Python画红色的心形线

腾讯内部目前已经有多个开发平台接入了腾讯混元大模型，工程师们可以使用腾讯混元来进行代码生成、代码补全、代码漏洞检测和修复、表格数据处理、数据库查询等工作。

比如，在IDE编程场景中，腾讯工蜂Copilot通过接入混元大模型，可根据注释生成对应代码，或基于上下文智能补全代码，大大提高了编程效率。混元大模型还可以帮助用户进行代码漏洞检测和修复，保障软件开发过程中的安全性。

腾讯混元大模型持续升级背后，离不开腾讯自研一站式机器学习平台Angel的支撑。自研AngelPTM训练框架可提供高效的分布式训练解决方案，具备业界领先的内存利用率和训练吞吐效率，训练速度相比业界主流框架提升1 倍；自研AngelHCF训练框架，具备从蒸馏、微调、压缩到模型加速的完整能力，支持多种模型并行，保证模型的最小化部署及最大化吞吐，推理速度相比业界主流框架FasterTransformer快1.3倍。

从2021年开始，腾讯先后推出千亿和万亿参数的NLP稀疏大模型，打破CLUE三大榜单纪录，实现在中文理解能力上的新突破。2023年9月混元大模型的亮相，代表腾讯在大模型理解和生成通路上的融合打通。随着文生图功能的出现，腾讯混元大模型加入了对图像的处理能力，模态进一步丰富。

大模型多模态交互能力被认为是通往通用人工智能的必由之路，也是不断扩充大模型能力象限的一个重要方向。据介绍，腾讯混元大模型正在不断强化图片、视频、音频等各类模态的处理能力，相关成果也将很快面向外界推出。

雷峰网

AI时代，拥有个人微信机器人AI助手！AI时代不落人后！

免费ChatGPT问答，办公、写作、生活好得力助手！

搜索微信号aigc666aigc999或上边扫码，即可拥有个人AI助手！

相关文章

发表回复 取消回复

发表回复取消回复