腾讯混元大模型文生图功能正式对外开放

腾讯混元 2023-11-02

欢迎大家来到腾讯混元文生图的世界，这里有一份详细的操作指南，请查收！

为了便于大家全面了解和操作腾讯混元文生图，该操作指南大概从以下几个方面展开：

1、腾讯混元文生图简介

2、腾讯混元文生图技术创新

3、 prompt使用注意事项

4、腾讯混元文生图测试尝鲜

5、 one more thing——彩蛋时刻

一、腾讯混元文生图简介

今天上午，腾讯混元大模型迎来全新升级，并正式对外开放“文生图”功能。升级后的腾讯混元中文效果整体超过GPT3.5，代码能力大幅提升20%，达到业界领先水平。

相比其他大模型，腾讯混元的文生图应用，在人像真实感、场景真实感上有比较明显的优势，同时，在中国风景、动漫游戏等场景等生成上有较好的表现。在业界公认难度较高的人脸画像生成上，腾讯混元也交出了比较令人满意的作品。

作为“从实践中来，到实践中去”的大模型，腾讯混元文生图能力，目前已经被用于素材创作，商品合成，游戏出图等多项业务中，此外在广告业务下的多轮测评中，腾讯混元文生图的案例优秀率和广告主采纳率分别达到86%和26%，均高于同类模型。

二、腾讯混元文生图技术创新

大模型文生图的难点体现在对提示词的语义理解，生成内容的合理性以及生成图片的效果，针对这三个技术难点，腾讯进行了专项的技术研究，提出了一系列原创算法，来保证生成图片的可用性和画质。

1、在语义理解方面，腾讯混元采用了中英文双语细粒度的模型，模型同时建模中英文实现双语理解，而不是通过翻译，通过优化算法提升了模型对细节的感知能力与生成效果，有效避免多文化差异下的理解错误。

2、在内容合理性方面，AI生成人体结构和手部经常容易变形。混元文生图通过增强算法模型的图像二维空间位置感知能力，并讲人体骨架和人手结构等先验信息引入到生成过程中，让生成的图像结构更合理，减少错误率。

3、在画面质感方面，混元文生图基于多模型融合的方法，提升生成质感。经过模型算法的优化之后，混元文生图的人像模型，包含发丝、皱纹等细节的效果提升了30%，场景模型，包含草木、波纹等细节的效果提升了25%。

三、prompt 使用注意事项

1、如果你想生成一张更接近真人感的照片，或接近实拍的图片。请使用“生成一张XX的图片”或者“生成一张XX的照片”，并加上“真实感”或“摄影风”等描述，如果使用“画一幅xx画”，会被识别成其他风格的图画。

2、如果你想要特定风格的图片，建议在提示词中加入该风格的描述，如油画风、赛博朋克风、水墨画风格、像素风、日漫动画风、儿童画等，或者使用灵感发现中的特定风格，不给出明确画风指示时，混元大模型随机生成常见风格图片。

3、对你想要的画面进行尽可能详细的描述，并建议多次调整你的提示词，比如“生成一副照片：亚洲女子，魅力，长发，戴墨镜，站在长城上，背景有红叶”、“画一幅亚洲女生的画，黑色与绿色相间的中短发，卡通人像，迪士尼风，民俗肖像，宁静脸孔”。

四、腾讯混元文生图尝鲜

1.1 真实感人像

生成可爱的亚洲 4 岁女孩穿着棉质连衣裙，大眼睛，古代中国，摄影风格，汉服

生成一个亚洲青年男生在高铁站，穿着休闲服装，背着双肩包，等待出行，高铁站内部，摄影风格，高度详细

生成生成一个亚洲中老年男人在乡野，穿着朴素，站在稻田旁，远处山峦，近景，摄影风格，摄影照片

生成一幅照片：亚洲女子，魅力，中短发，戴墨镜，站在长城上，背景有红叶

生成一张古风美女的照片，穿着汉服，扎着发髻，摄影风

1.2 真实感场景（人文&风景）

生成图片，一个城市CBD办公楼，现代化设计，高层建筑，玻璃幕墙，近景拍摄，摄影风格，摄影照片

生成日式酒店外观，传统建筑风格，瓦片屋顶，樱花树，远景，摄影风格，摄影照片

雪山，高耸入云，白雪皑皑，远景，摄影风格，摄影照片

云海，晨光照耀，云层层叠，宁静的气氛，远景，摄影风格，摄影照片

生成一幅照片：桂林漓江的山水，江上有一艘小船

生成一张长城的照片，摄影风，真实感

生成图片，布达拉宫风景，金黄色的屋顶，蓝天白云，雪山环绕，广角，摄影风格，摄影照片

2.1 2D动漫人像

生成2D 现代动漫，一个身穿黑色长裙，头戴黑色蝴蝶结发饰的少女，近景的图片

一个穿着淡黄色衣服的年轻女孩的卡通图画，头发是黑色的，卷曲的中长头发，戴着大框的眼镜，郁金香元素。用迪士尼动漫风格的人物设计，宁静的面孔，民俗肖像

生成2D Q版古风动漫，一名身着黑色道袍的道士，手执法器，面容阴沉

帮我画一个拿着奶茶的甄嬛，扁平插画，可爱Q版

画一幅画：一位女性，她穿着灰色的夹克和黑色的衬衫。她坐在一张桌子前，桌子上堆满了物品，可能是货物或工作设备

2.2 平面场景

生成2D 水墨，水彩风，一个古风农庄，稻田麦浪，农家小院，清新自然，与自然和谐

生成2D 现代场景动漫，一个都市街道，高楼大厦，车水马龙，繁忙喧嚣，商业气息

生成2D 古风场景，一个古风酒楼，古色古香，美食的香气，温馨舒适，美食的殿堂

画一幅画：小企鹅在树下行走，突然一个苹果从树上掉下

3.1 3D/CG风格人像

生成一张图片：白色银发的女生，戴着耳环，看着前方，CG风格

生成 3D 科幻人物，一名身穿黑色铠甲，身上散发着蓝光的机甲战士。他站在一片城市废墟中

生成3D 西方魔幻人物，亡灵领主，威震鬼域，统治着幽冥的亡灵世界

3D 游戏军事人物，一个身着迷彩服的陆地士兵

生成3D Q版动物，小企鹅，呆萌可爱，生活在南极的冰川边缘

3.2 3D/CG场景

生成3D 游戏军事场景动漫，雪地战场，白茫茫一片，暴风雪肆虐，寒冷刺骨

生成3D 游戏军事场景动漫，城市战区，废墟瓦砾，焦黑的建筑，空气中弥漫硝烟

生成3D 赛车动漫，一辆红色跑车在城市街道上疾驰而过，风景在车窗外迅速闪过

3.3 3D氛围感场景

帮我生成一张图片：一个小女孩在森林中奔跑、带着灯笼、身旁飞着萤火虫、月亮很亮，氛围感，CG风格

生成一张赛博朋克风格的图片：一只立体的猫穿着赛博朋克风的衣服，周围是灯红酒绿的城市场景，潮湿的地面上反映了城市的倒影

4 古诗词

帮我生成一张图片：空山新雨后，天气晚来秋，水墨风格

请帮我生成一张图片：轻舟已过万重山，水墨画风格

请帮我生成一张图片：春江水暖鸭先知，水墨画风格

帮我生成一张图片：墙角数枝梅，凌寒独自开，水墨风格

画一幅渔舟唱晚的画

生成一幅水墨画：窗前明月光，疑是地上霜。举头望明月，低头思故乡

五、one more thing-彩蛋时刻

过去一个月，腾讯混元大模型不仅各项能力均有升级，代码、数学能力也大幅提升。

经过对32种主流语言代码文件、各类计算机书籍和博客的学习增训，腾讯混元代码处理水平提升超过20%，代码处理效果胜出ChatGPT 6.34%，在HumanEval公开测试集指标上全面超过Starcoder、Codellama等业界头部开源代码大模型。

只需输入简单的指令如“帮我用前端语言实现一个贪吃蛇”，腾讯混元便能自动生成可运行的代码，快速制作出一个贪吃蛇小游戏。此外，腾讯混元还支持Python、C++、Java、Javascript等多种语言的指令生成，比如输入“用Python画红色的心形线”，腾讯混元会提供代码库选择、安装命令、绘制代码等具体操作步骤的指引。

腾讯内部目前已经有多个开发平台接入了腾讯混元大模型，工程师们可以使用腾讯混元来进行代码生成、代码补全、代码漏洞检测和修复、表格数据处理、数据库查询等工作。

比如，在IDE编程场景中，腾讯工蜂Copilot通过接入混元大模型，可根据注释生成对应代码，或基于上下文智能补全代码，大大提高了编程效率。混元大模型还可以帮助用户进行代码漏洞检测和修复，保障软件开发过程中的安全性。

腾讯混元大模型持续升级背后，离不开腾讯自研一站式机器学习平台Angel的支撑。自研AngelPTM训练框架可提供高效的分布式训练解决方案，具备业界领先的内存利用率和训练吞吐效率，训练速度相比业界主流框架提升1 倍；自研AngelHCF训练框架，具备从蒸馏、微调、压缩到模型加速的完整能力，支持多种模型并行，保证模型的最小化部署及最大化吞吐，推理速度相比业界主流框架FasterTransformer快1.3倍。

作为实用级的通用大模型，目前，超过180个腾讯内部业务已接入腾讯混元，包括腾讯会议、腾讯文档、企业微信、腾讯广告和微信搜一搜等。服务公司外部零售、教育、金融、医疗、传媒、交通、政务等多个行业客户。

—END—

继续滑动看下一个

《鱿鱼游戏2》今天下午四点开播，网友无心上班了，导演悄悄剧透

刘恺威近况曝光，父亲刘丹证实已分手，目前失业在家，没有资源

紧急通告！三高的“克星”终于被找到了！！不是吃素和控糖,而是多喝它....

话费充值活动来了：95元充值100元电话费！

跟着南通住建局学“朝令夕改”

腾讯混元大模型文生图功能正式对外开放

您可能也对以下帖子感兴趣

《鱿鱼游戏2》今天下午四点开播，网友无心上班了，导演悄悄剧透

刘恺威近况曝光，父亲刘丹证实已分手，目前失业在家，没有资源

紧急通告！三高的“克星”终于被找到了！！不是吃素和控糖,而是多喝它....

话费充值活动来了：95元充值100元电话费！

跟着南通住建局学“朝令夕改”

生成图片，分享到微信朋友圈

腾讯混元大模型文生图功能正式对外开放

您可能也对以下帖子感兴趣