文章主题:腾讯混元大模型, 图像自动生成, 人工智能, 应用场景

666AI工具大全,助力做AI时代先行者!

今天是10月26日,腾讯公司发布了一条令人振奋的消息:其混元大模型经过再次升级,已经正式开放了“文生图”功能,向外界展示了腾讯在图像自动生成领域所取得的显著成果。这一升级意味着腾讯混元中文能力的整体表现超过了GPT3.5,同时,在代码能力方面也取得了显著的提升,达到了业界领先水平。

腾讯混元大模型,以其实用级的特性,在各个领域展现出广泛的应用价值。至今,已有超过180项腾讯内部业务与腾讯混元紧密集成,其中包括腾讯会议、腾讯文档、企业微信、腾讯广告以及微信搜一搜等。此外,近期,QQ浏览器更是基于腾讯混元推出了“PDF阅读助手”,这款工具不仅拥有智能摘要、智能问答和多轮提问等功能,更是在pdf文件处理上展现出了强大的能力。

在当前的数字化时代,腾讯云已经成功吸引了一批来自不同行业的客户,这些客户涵盖了零售、教育、金融、医疗、传媒、交通、政务等众多领域。他们利用腾讯云的便利性,通过调用腾讯混元大模型API,将人工智能的应用范围拓展到了智能问答、内容创作、数据分析、代码助手等多个领域。值得一提的是,在今年9月份,首批通过备案的腾讯混元大模型已经开始面向C端用户陆续开放体验。这意味着,广大用户现在只需要通过小程序或者网页端,就可以直接与腾讯混元进行对话,体验到人工智能带来的便捷和高效。

在本次场合,腾讯自研的面向特定领域的7B和13B模型初次露面,令人惊喜的是,在达到相同效果的前提下,它们所需的Token数量大大减少,从而显著提升了训练效率。经过实际测试,这两个模型的表现均优于我国及海外的开源模型,展现出卓越的性价比和效率,能够更好地推动应用落地,满足各种特定的场景和业务需求,助力腾讯全面拥抱大模型时代的到来。

经了解,腾讯拥有从模型算法到机器学习框架以及AI基础设施的自研技术全链路,这为其大模型的迅速迭代提供了有力保障。自从首次亮相以来,腾讯混元大模型便步入了快速升级的阶段。依托于自研算法,模型的稳定性和可靠性得到了稳步提升。

 腾讯混元文生图惊艳亮相,广告场景应用效果明显

文生图,作为人工智能领域中的核心科技之一,对于展现通用大模型的实力具有重要的意义。它不仅对模型算法、训练平台以及算力设施等方面提出了较高的标准,同时也为相关行业的技术发展和创新提供了有力的支撑。

腾讯最早在广告场景进行AI自动生成图像的探索,在此过程中积累了深厚的研发能力。据介绍,相比其他大模型,腾讯混元的文生图应用,在人像真实感、场景真实感上有比较明显的优势,同时,在中国风景、动漫游戏等场景等生成上有较好的表现。

在业界公认难度较高的人脸画像生成上,腾讯混元也交出了令人满意的作品。比如,输入提示词“生成可爱的亚洲 4 岁女孩穿着棉质连衣裙,大眼睛,古代中国,摄影风格,汉服”,腾讯混元大模型生成如下:

 

可以看到,腾讯混元大模型可以很好地理解提示词中提到的“棉质连衣裙”、“汉服”等内容,同时在风格上,也通过建筑和风景等衬托,很好的展示了“古代中国”的风格要求。

另外一个例子中,输入提示词“ 一个城市CBD办公楼,现代化设计,高层建筑,玻璃幕墙,近景拍摄,摄影风格,摄影照片”,腾讯混元大模型交出了如下作品:

广告
胆小者勿入!五四三二一…恐怖的躲猫猫游戏现在开始!
×
 

更简单一些,输入提示词“轻舟已过万重山,水墨画风格”就可以得到下面的图片:

 

大模型文生图的难点体现在对提示词的语义理解、生成内容的合理性以及生成图片的效果。针对这三个技术难点,腾讯进行了专项的技术研究,提出了一系列原创算法,来保证生成图片的可用性和画质。

在语义理解方面,腾讯混元采用了中英文双语细粒度的模型。模型同时建模中英文实现双语理解,并通过优化算法提升了模型对细节的感知能力与生成效果,有效避免多文化差异下的理解错误。

在内容合理性方面,AI生成人体结构和手部经常容易变形。混元文生图通过增强算法模型的图像二维空间位置感知能力,并将人体骨架和人手结构等先验信息引入到生成过程中,让生成的图像结构更合理,减少错误率。

在画面质感方面,混元文生图基于多模型融合的方法,提升生成质感。经过模型算法的优化之后,混元文生图的人像模型,包含发丝、皱纹等细节的效果提升了30%,场景模型,包含草木、波纹等细节的效果提升了25%。

广告
从秘书起步,十年内无人超越,以一己之力力挽狂澜成就一段传奇
×
 

prompt:生成一幅照片:桂林漓江的山水,江上有一艘小船

作为“从实践中来,到实践中去”的大模型,腾讯混元文生图能力,目前已经被用于素材创作、商品合成、游戏出图等多项业务中,此外在广告业务下的多轮测评中,腾讯混元文生图的案例优秀率和广告主采纳率分别达到86%和26%,均高于同类模型。

代码能力行业领先,腾讯内部已经用大模型“写”代码

过去一个月,腾讯混元大模型不仅各项能力均有升级,代码、数学能力也大幅提升。经过对32种主流语言代码文件、各类计算机书籍和博客的学习增训,腾讯混元代码处理水平提升超过20%,代码处理效果胜出ChatGPT 6.34%,在HumanEval公开测试集指标上全面超过Starcoder、Codellama等业界头部开源代码大模型。

只需输入简单的指令如“帮我用前端语言实现一个贪吃蛇”,腾讯混元便能自动生成可运行的代码,快速制作出一个贪吃蛇小游戏。此外,腾讯混元还支持Python、C++、Java、Javascript等多种语言的指令生成,比如输入“用Python画红色的心形线”,腾讯混元会提供代码库选择、安装命令、绘制代码等具体操作步骤的指引。

 

Prompt:用Python画红色的心形线

腾讯内部目前已经有多个开发平台接入了腾讯混元大模型,工程师们可以使用腾讯混元来进行代码生成、代码补全、代码漏洞检测和修复、表格数据处理、数据库查询等工作。

比如,在IDE编程场景中,腾讯工蜂Copilot通过接入混元大模型,可根据注释生成对应代码,或基于上下文智能补全代码,大大提高了编程效率。混元大模型还可以帮助用户进行代码漏洞检测和修复,保障软件开发过程中的安全性。

腾讯混元大模型持续升级背后,离不开腾讯自研一站式机器学习平台Angel的支撑。自研AngelPTM训练框架可提供高效的分布式训练解决方案,具备业界领先的内存利用率和训练吞吐效率,训练速度相比业界主流框架提升1 倍;自研AngelHCF训练框架,具备从蒸馏、微调、压缩到模型加速的完整能力,支持多种模型并行,保证模型的最小化部署及最大化吞吐,推理速度相比业界主流框架FasterTransformer快1.3倍。

从2021年开始,腾讯先后推出千亿和万亿参数的NLP稀疏大模型,打破CLUE三大榜单纪录,实现在中文理解能力上的新突破。2023年9月混元大模型的亮相,代表腾讯在大模型理解和生成通路上的融合打通。随着文生图功能的出现,腾讯混元大模型加入了对图像的处理能力,模态进一步丰富。

大模型多模态交互能力被认为是通往通用人工智能的必由之路,也是不断扩充大模型能力象限的一个重要方向。据介绍,腾讯混元大模型正在不断强化图片、视频、音频等各类模态的处理能力,相关成果也将很快面向外界推出。

AI时代,拥有个人微信机器人AI助手!AI时代不落人后!

免费ChatGPT问答,办公、写作、生活好得力助手!

搜索微信号aigc666aigc999或上边扫码,即可拥有个人AI助手!

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注