腾讯混元大模型开启“文生图”新时代，你想要的图像它都能生成

2023年10月27日由 neo 发表 614 0

腾讯混元大模型近日升级了“文生图”功能，可以根据用户输入的文字，生成各种风格和质感的图片。这个功能是由腾讯自主研发的大规模语言模型支持的，目前已经达到了GPT3.5的水平，代码能力也有了20%的提升。

9ff37b33-1b24-4518-8a4c-93c872114734

“文生图”功能的技术难点在于对提示词的语义理解，生成内容的合理性和生成图片的效果。为了解决这些难点，腾讯提出了一系列原创算法：在语义理解方面，腾讯混元采用了中英文双语细粒度的模型，同时建模中英文实现双语理解，通过优化算法提升了模型对细节的感知能力和生成效果；在内容合理性方面，腾讯混元通过增强算法模型的图像二维空间位置感知能力，并将人体骨架和人手结构等先验信息引入到生成过程中，让生成的图像结构更合理，减少错误率；在画面质感方面，腾讯混元基于多模型融合的方法，提升生成质感。经过模型算法的优化之后，混元文生图的人像模型包含发丝、皱纹等细节的效果提升了30%，场景模型包含草木、波纹等细节的效果提升了25%。

用户想要生成不同风格和质感的图片，可以在提示词中加入相应的描述，比如“真实感”、“摄影风”、“油画风”、“赛博朋克风”等。用户还可以对画面进行尽可能详细地描述，以获得满意的效果。

d5ce4e75-7160-4736-9c50-c0cf975b58f3

目前，腾讯内部已经有多个开发平台接入了腾讯混元大模型，已有超过180个内部业务接入混元，包括腾讯会议、腾讯文档、企业微信、腾讯广告和微信搜一搜等。有网友反馈已经通过混元大模型内测审核，并分享了相关操作页面。从截图中可以看到，混元大模型支持制定面试大纲、旅行计划、PPT大纲、健身计划等功能，分为工作、编程、营销、生活等选项。此外，混元大模型还支持AI对话功能，已经通过的内测申请的用户可以尝鲜一下。

文章来源：https://www.ithome.com/0/727/821.htm

标签：

大模型人工智能

0 评论

欢迎关注ATYUN官方公众号

商务合作及内容投稿请联系邮箱:bd@atyun.com

上一篇 Midjourney发布全新网站，浏览器图像生成功能即将上线

下一篇 Shutterstock推出AI编辑功能，扩展库存图片创意可能性

评论登录

要发表评论，您必须先登录。

jonatasgrosman/wav2vec2-large-xlsr-53-english facebook/dino-vitb16 bert-base-uncased xlm-roberta-large xlm-roberta-base gpt2 microsoft/resnet-50 facebook/dino-vits8

AGENTIC AI如何塑造未来