无影AgentBay – 阿里云推出的云端Agent开发平台

无影AgentBay是什么

无影AgentBay是阿里云推出的提供多模态云端运行环境和专家Agent平台,支持浏览器、桌面、移动端、代码的自动化与远程控制。平台具备视觉理解、自然语言控制等AI技能,能无缝切换任务,调用云上算力。仅需三行代码即可接入,集成云上沙箱、数据持久化和企业级安全等核心能力。无影AgentBay适用科研、金融、教育、医疗等多场景,助力开发者高效创新,推动智能体全场景应用。

无影AgentBay

无影AgentBay的主要功能

  • 多系统支持:兼容Windows、Linux、Android等主流系统,支持桌面、移动、浏览器、代码空间等多种应用场景。
  • AI技能集成:具备视觉理解、自然语言控制、任务解析等AI能力,支持多模态输入与智能决策。
  • 云上沙箱环境:提供安全隔离的沙箱环境,覆盖多系统和多应用层,支持Agent自动化应用。
  • 数据持久化:支持状态和内存级别的持久化,确保任务切换时状态连续,资源按需加载,无需重启。
  • 企业级安全:采用数据加密传输和权限严格隔离,确保“本地环境零侵入”,为用户和厂商提供双重安全保障。
  • 简单接入与扩展:提供API、SDK和MCP等多种接入方式,支持一键配置和快速集成,降低开发门槛。
  • 高性能算力:依托阿里云全球基础设施,提供强大的GPU算力支持,满足复杂任务需求。

如何使用无影AgentBay

  • 登录阿里云无影控制台:访问无影AgentBay官网:https://www.aliyun.com/activity/wuying/aiagent,点击前往产品控制台。按提示完成注册和登录。
  • 申请API Key和MCP配置描述:在无影AgentBay控制台中,找到“服务管理”选项。按照提示申请API Key,同时获取MCP配置描述,用于后续的配置步骤。
  • 配置MCP Server
    • 在MCP Host侧一键配置无影MCP Server。
    • 在无影AgentBay平台左侧导航栏中找到服务管理,并查看API Key。
    • 点击配置资源,在镜像下拉列表中选择一个镜像。
    • 在MCP信息右上角点击复制代码。
  • 安装到本地:打开Cursor设置面板,进入MCP部分。在MCP Servers面板上,点击右上角的“添加全局MCP服务器”。把刚才复制的代码粘贴进打开的mcp.json文件中。
  • 测试并完成配置:保存mcp.json文件中的配置,关闭设置面板。在Cursor中测试连接,确保MCP Server配置正确且能正常工作。
  • 开始使用无影AgentBay:配置完成后,开始使用无影AgentBay进行各种任务,如代码运行、网页浏览、数据分析等。在Cursor中,能添加新的全局MCP服务器,进行进一步的配置和使用。

无影AgentBay的应用场景

  • 金融分析:实时监控市场动态,为金融分析提供多环境数据采集与分析能力,形成专业的智能金融分析建议。
  • 医疗诊断:平台赋予智能体医疗知识和操作能力,协助医生进行病情分析与诊断,实现病人个性化病历的长期跟踪管理。
  • 教育:用多环境操作能力,为学习者提供个性化的学习内容和实践机会,构建因材施教的数字人教师。
  • 跨境电商:无影AgentBay能帮助企业实时获取全球商品信息,打通交易流程,实现高效运营。
  • 企业数字化转型:在云端提供定制化的桌面环境,支持企业应用智能化改造,实现算力按需分配和一站式运维管理。

灵动画布 – 可灵AI推出的AI创意工作台

灵动画布是什么

灵动画布是快手可灵AI在世界人工智能大会(WAIC)期间发布的全新创意工作台功能。为创作者提供了一个多人协同创作的平台,支持最多5人同时在一个画布内进行创作,实现素材共享、实时联动和一键导出,打造更流畅的创作闭环。特别适合团队协作项目,能有效激发创意,提升创作效率。通过“灵动画布”,创作者可以将零散的创意想法转化为文本、图像或视频节点,高效串联成完整的视觉作品。

 

灵动画布的主要功能

  • 多人协同创作:支持最多5人协作,创作者可以在同一画布内进行实时创作,适合团队合作。团队成员可以共享素材,实时看到彼此的操作和修改。
  • 一站式创作流程:从创意构思到最终成品,创作者可以在一个平台上完成。
  • 一键导出功能:创作完成后,可以快速将作品导出为最终的视频或图像。
  • 无限可视化空间:创作者可以在画布上自由布局创意节点,包括文本、图像和视频。
  • 灵活的创意组织:通过节点连接,创作者可以将创意元素高效串联,形成完整的创作思路。
  • 智能创作辅助:借助AI技术,自动识别和理解创意元素,提供智能建议和优化。
  • 提升创作效率:AI可以帮助创作者快速生成初步内容,减少重复性工作。
  • 局部参考功能:精准素材引用,创作者可以指定参考图中的特定部分(如人物、场景、道具等),避免不必要的元素干扰。
  • 生成结果更可控:确保生成的内容更符合创作者的预期,提升创作的精准度。
  • 操作记录与回溯:记录创作过程中的每一步操作,方便创作者随时回溯和修改。
  • 版本管理:支持不同版本的保存和比较,确保创作的灵活性和可追溯性。

如何使用灵动画布

  • 使用平台
    • 网页端:访问可灵AI的官网,注册登录后即可在线使用。
    • 手机端:下载可灵AI APP的Android或iOS版进行使用。
  • 使用步骤
    • 创建画布:登录后,进入“灵动画布”功能界面,创建一个新的画布。
    • 添加元素:在画布上添加创意节点,包括文本、图像或视频等元素。
    • 多人协作:邀请最多4名其他用户加入画布,共同创作。团队成员可以在同一画布内实时操作,共享素材、实时联动。
    • 智能辅助:利用AI的智能辅助功能,系统会根据添加的元素和描述,自动提供创作建议和优化方案。
    • 编辑与调整:根据需要对画布上的元素进行编辑和调整,如修改文本内容、调整图像位置等。
    • 生成作品:完成创作后,点击“一键导出”功能,将画布上的内容导出为最终的视频或图像作品。
  • 注意事项
    • 灵感值:首次注册用户会获赠一定数量的灵感值,可用于生成图片及视频,每日登录也会获赠灵感值,但获赠灵感值会在24小时内过期。
    • 素材管理:合理利用画布内的素材共享功能,确保团队成员都能高效获取所需素材。

灵动画布的应用场景

  • 图像与视频生成:创作者可以在“灵动画布”上将零散的创意想法转化为文本、图像或视频节点,高效串联成完整的视觉作品。
  • 教学演示动画:教师可以用“灵动画布”快速制作教学演示动画,将复杂的知识点以更直观的方式呈现给学生。
  • 学生创意项目:学生可以用工具进行创意项目的协作创作,提升团队合作能力和创造力。
  • 产品展示视频:企业可以快速生成产品展示视频,用于广告、营销等场景,提升产品宣传效果。
  • 个人创意表达:个人创作者可以用“灵动画布”实现自己的创意想法,快速生成个性化的图像和视频。

腾讯混元3D世界模型正式发布并开源

今天,在2025世界人工智能大会腾讯论坛上,腾讯正式发布混元3D世界模型 1.0,并全面开源。

业界首个开源沉浸漫游交互可仿真世界生成模型,为游戏开发、VR、数字内容创作等领域带来了全新的可能性。

除3D世界模型外,腾讯混元披露了包括端侧混合推理语言模型、多模态理解模型游戏视觉模型在内的一系列开源计划

作为此次发布的亮点之一腾讯混元3D世界模型1.0融合全景视觉成与分层3D重建技术同时支持文字和图片输入,实现了高质量、风格多样的可漫游3D场景生成

过去需要专业建模团队数周才能搭建的3D虚拟世界,现在只需一句文字或一张图片,几分钟内即可生成。

 

对游戏开发者而言,混元3D世界模型极大简化了3D场景构建流程,只需输入简单指令,模型即可快速生成包含建筑、地形、植被的完整3D场景输出的Mesh文件可用于游戏原型搭建或关卡设计还能灵活调整前景物体、更换天空背景,满足个性化创作需求。

无建模经验的普通用户,通过混元 3D 创作引擎仅需一句话或者一张图即可快速生成360°沉浸式视觉空间,生成的场景可无缝导入Vision Pro等虚拟头显,带来沉浸式体验。

混元3D世界模型1.0的核心在于其创新的「语意层次化3D场景表征及生成算法」。

该算法将复杂3D世界解构为不同语意层级,实现前景与背景、地面与天空的智能分离,不仅生成视觉效果逼真的整体场景,还能输出标准化的3D Mesh资产,兼容Unity、Unreal Engine、Blender等主流工具。用户可对场景内元素进行独立编辑或物理仿真,无缝衔接AIGC技术与传统CG工作流。

GLM-4.5 – 智谱推出的面向推理、代码与智能体的开源 SOTA 模型

GLM-4.5是什么

GLM-4.5 是智谱推出的新一代旗舰模型,专为智能体应用打造,是首款原生融合推理、代码和智能体能力的开源 SOTA 模型。采用混合专家(MoE)架构,有两个版本:GLM-4.5(3550 亿参数,320 亿激活)和 GLM-4.5-Air(1060 亿参数,120 亿激活)。模型在多个评测基准中表现卓越,综合性能达到开源模型的顶尖水平,尤其在代码智能体场景中表现优异。支持混合推理模式,提供思考模式和非思考模式,兼顾复杂任务和即时响应需求。

参数效率翻倍,API价格仅为Claude的1/10,速度最快可达100tokens/秒。率先在一个模型中实现多能力原生融合并取得重要技术突破——单个模型同时具备强大的推理、代码、智能体等能力,已上线智谱清言和Z.ai开放免费体验。

GLM-4.5

通义万相2.2 – 阿里开源的AI视频生成模型

通义万相2.2(Wan2.2)是阿里巴巴开源的先进AI视频生成模型。共开源文生视频(Wan2.2-T2V-A14B)、图生视频(Wan2.2-I2V-A14B)和统一视频生成(Wan2.2-IT2V-5B)三款模型,总参数量达270亿。模型首次引入混合专家(MoE)架构,有效提升生成质量和计算效率,同时首创电影级美学控制系统,能精准控制光影、色彩、构图等美学效果。此次开源的5B参数紧凑视频生成模型,支持文本和图像生成视频,能在消费级显卡上运行,基于高效的3D VAE架构,实现高压缩率和快速生成高清视频的能力。目前,开发者可通过GitHub、HuggingFace等平台获取模型和代码,企业可通过阿里云百炼调用API进行应用开发,用户能在通义万相官网和通义APP直接体验。

通义万相2.2
通义万相2.2的主要功能
文生视频(Text-to-Video):根据输入的文本描述生成相应的视频内容。例如,输入“一只猫在草地上奔跑”,模型能生成一段符合描述的视频。
图生视频(Image-to-Video):根据输入的图片生成视频,模型根据图片内容生成动态场景,让图片“活”起来。
统一视频生成(Text-Image-to-Video):结合文本和图片生成视频,同时用文本描述和图片信息,生成更精准的视频内容。
电影级美学控制:通过光影、色彩、构图、微表情等控制,生成具有专业电影质感的视频。用户通过输入相关关键词(如“暖色调”“中心构图”)定制视频的美学风格。
复杂运动生成:能生成复杂的运动场景和人物交互,提升视频的动态表现力和真实感。
通义万相2.2的技术原理
混合专家(MoE)架构:引入MoE架构,将模型分为高噪声专家和低噪声专家。高噪声专家负责视频的整体布局,低噪声专家负责细节完善。在保持计算成本不变的情况下,大幅提升模型的参数量和生成质量。
扩散模型(Diffusion Model):基于扩散模型作为基础架构,通过逐步去除噪声来生成高质量的视频内容。MoE架构与扩散模型结合,能进一步优化生成效果。
高压缩率3D VAE:为提高模型的效率,通义万相2.2基于高压缩率的3D变分自编码器(VAE)。架构实现了时间、空间的高压缩比,让模型能在消费级显卡上快速生成高清视频。
大规模数据训练:模型在大规模数据集上进行训练,包括更多的图像和视频数据,提升模型在多种场景下的泛化能力和生成质量。
美学数据标注:基于精心标注的美学数据(如光影、色彩、构图等),模型能生成具有专业电影质感的视频内容,满足用户对视频美学的定制需求。
通义万相2.2的项目地址
GitHub仓库:https://github.com/Wan-Video/Wan2.2
HuggingFace模型库:https://huggingface.co/Wan-AI/models
如何使用通义万相2.2
访问官网: 访问通义万相的官方网站或下载通义APP进行体验。
选择模型:在模型选择下拉框中选择通义万相2.2。
选择体验模式:
文生视频(Text-to-Video):输入文本描述,例如“一只猫在草地上奔跑”,点击生成按钮,能看到生成的视频。
图生视频(Image-to-Video):上传一张图片,模型根据图片内容生成动态视频。
统一视频生成(Text-Image-to-Video):结合文本描述和上传的图片,生成更精准的视频内容。
调整参数(可选):用户根据需要调整视频的分辨率、帧率等参数。用电影级美学控制系统,通过输入关键词(如“暖色调”“中心构图”)定制视频的美学风格。
查看生成结果:生成的视频直接在网页上显示,用户能下载或分享生成的视频。
通义万相2.2的应用场景
短视频创作:创作者快速生成吸引人的短视频内容,用于社交媒体平台,节省创作时间和成本。
广告与营销:广告公司和品牌生成高质量的广告视频,提升广告效果和品牌影响力。
教育与培训:教育机构和企业生成生动的教育视频和培训材料,提升学习效果和培训质量。
影视制作:影视制作团队快速生成场景设计和动画片段,提升创作效率,降低制作成本。
新闻与媒体:新闻机构和媒体生成动画和视觉效果,增强新闻报道的视觉效果和观众参与度。

讯飞绘文

讯飞绘文是科大讯飞推出的免费一站式AIGC内容运营平台,集成讯飞星火MAX、DeepSeek V3-0324 和 DeepSeek R1三大模型,为内容创作者提供高效、智能的写作解决方案。集选题推荐、智能写作、AI配图、排版润色、内容审查、多平台发布及数据分析等功能于一体,能快速生成热点文章、营销文案、学术论文等各类内容。用户可以通过强大的AI选题功能获取灵感,一键生成文章草稿,并合私域知识库创作更具针对性的内容。智能配图和自动排版功能可提升内容的视觉效果,内容审查功能则能帮助用户降低风险。讯飞绘文支持将内容一键分发至多个平台,汇总数据提供优化建议,助力用户提升内容运营效率。

讯飞绘文的主要功能

  • AI智能写作:能根据用户输入的主题或关键词快速生成文章草稿,支持多种文章类型,如深度稿件、通用稿件等,内容质量较高。
  • 选题推荐:基于大数据分析,推荐热门和潜在的创作主题,结合热点、节日、文章、图片材料等信息,为创作者提供丰富的选题建议。
  • 润色优化:对文章进行语言修饰,提升文章的可读性和专业性,确保语句流畅、逻辑严谨。
  • 多语言支持:支持英、俄、日、韩等10种外语文本生成,以及多语种文本互译。
  • AI配图:根据文章内容自动生成或匹配合适的图片,确保图文并茂,提升视觉吸引力。
  • 智能排版:自动优化文章布局,提供多种排版模板,支持一键生成Word、PPT文档,提升阅读体验。
  • 内容发布与管理功能
  • 一键发布:支持将内容一键分发至微信公众号、今日头条、小红书、百家号、知乎等主流社交媒体和内容平台。
  • 数据分析:自动汇总多平台数据,帮助创作者了解内容曝光与互动情况,为后续创作和运营提供数据支持。
  • 多模型选配:集成讯飞星火MAX、DeepSeek V3-0324 和 DeepSeek R1 三大差异化模型,创作者可根据不同需求选择模型。
  • 思维链式创作:首创模块化创作路径,涵盖30多种不同体裁与思维链式写作模式,帮助创作者拆解创作任务,精准输出高质量内容。
  • 轻图文功能:专为自媒体、电商等领域的创作者量身定制,输入一句话主题即可生成图文并茂的作品,支持组件化操作和多种风格模板。

如何使用讯飞绘文

  • 下载与安装:访问讯飞绘文的官网(turbodesk.xfyun.cn),使用手机号或微信扫码注册登录。
  • 选择功能模块:登录后,进入操作界面,选择需要的功能模块,如选题推荐、轻图文,通用笔记,演讲稿等。
  • 选题推荐:在“选题库”中浏览热点话题或灵感启发,选择感兴趣的主题进行创作。
  • AI写作:输入主题或关键词后,点击“写成文章”,平台会生成多篇草稿,用户可以选择满意的草稿并进一步修改。
  • 润色优化:对生成的文章进行润色、扩写、简写或续写,提升文章质量。
  • AI配图:选中需要配图的段落,AI会自动提取关键词并生成多张配图,用户也可以手动输入描述词。
  • 智能排版:选择内置的排版模板,一键套用并灵活调整,确保文章在不同平台上的展示效果。
  • 内容发布与管理:完成创作后,点击“多平台一键分发”,将内容发布到微信公众号、今日头条、小红书等平台。平台会自动汇总多平台数据,提供账号优化建议。
  • 私域知识融合:结合企业或个人的专属素材生成定制化内容。
  • AI审查:自动对内容进行纠错校对和风险审查,确保符合平台规则。

讯飞绘文的产品定价

  • 免费使用

讯飞绘文的应用场景

  • 企业公众号运营:企业运营团队可以通过讯飞绘文快速生成高质量的文章和配图,提升公众号内容的发布效率,同时结合数据分析功能优化内容策略。
  • 新闻媒体:媒体记者可以用讯飞绘文的热点选题推荐和AI写作功能,快速生成新闻初稿,结合实时热点快速发稿,抢占时效性。
  • 自媒体创作:自媒体创作者可以用讯飞绘文快速生成热点文章和吸引眼球的图文内容,提升创作效率和粉丝互动。
  • 电商平台:商家可以用讯飞绘文生成产品描述、营销文案等内容,提升电商运营效率。
  • 教育培训:教育工作者可以用讯飞绘文制作教学内容、课件、知识库整理等。

讯飞绘文的适用人群

  • 自媒体创作者:用讯飞绘文快速生成热点文章和吸引眼球的图文内容,提升创作效率和粉丝互动。
  • 媒体记者:通过讯飞绘文迅速获取新闻选题,一键生成草稿,提高新闻报道的速度和准确性。
  • 文案策划:结合私域知识库,用讯飞绘文创作有针对性的营销文案,增强品牌传播效果。
  • 企业公众号运营者:用讯飞绘文高效规划和发布企业内容,通过数据分析优化内容策略。
  • 学术研究人员:用讯飞绘文整理资料、撰写论文,提升学术写作的质量和效率。

Deep Video Discovery – 微软推出的深度视频探索智能体

Deep Video Discovery是什么

Deep Video Discovery(DVD)是微软推出的深度视频探索智能体,专为理解和分析长视频设计。Deep Video Discovery将长视频分割成多个较短的片段,基于大型语言模型(LLM)的高级推理能力,自主地规划和选择合适的工具及参数来收集信息。Deep Video Discovery配备一套搜索中心的工具,包括全局浏览、片段搜索和帧检查,能在不同层次上收集信息,基于迭代推理逐步构建对视频内容的理解。在多个长视频理解基准测试中,Deep Video Discovery均取得最先进的性能,显著提高长视频理解的准确性和效率。

Deep Video Discovery

Deep Video Discovery的主要功能

  • 多粒度视频理解:从全局、片段和帧三个层次理解和分析视频内容,提供全面的视频理解能力。
  • 自主搜索与推理:自主地规划和执行搜索策略,根据用户查询动态选择合适的工具和参数,逐步收集信息并构建对视频内容的理解。
  • 高效信息检索:基于全局浏览、片段搜索和帧检查等工具,快速定位和提取与用户查询相关的视频片段和细节。
  • 长视频理解:擅长处理长达数小时的信息密集型视频,能有效解决长视频理解中的时间和空间复杂性问题。
  • 灵活的工具使用:根据不同的任务需求,灵活组合和使用多种工具,实现高效的视频内容分析和问题回答。

Deep Video Discovery的技术原理

  • 多粒度视频数据库构建:将长视频均匀分割成多个较短的片段(clips),每个片段大约5秒。从全局、片段和帧三个层次提取视频信息。全局层提供视频的主体和事件总结,片段层提供文本描述(caption),帧层保留原始像素信息。构建一个包含解码帧、文本描述和对应嵌入向量的结构化数据库,支持快速检索和详细分析。
  • 自主搜索与答案生成
    • 全局浏览(Global Browse):提供视频的全局总结,帮助代理快速解视频的主体和主要事件。
    • 片段搜索(Clip Search):基于文本嵌入匹配,快速检索与用户查询相关的视频片段。
    • 帧检查(Frame Inspect):在特定时间范围内进行细粒度的视觉问答(VQA),提取帧级别的详细信息。
    • 自主代理设计:Agent基于迭代的观察-推理-行动循环,用LLM的推理能力,动态选择和使用工具,逐步收集信息并构建对视频内容的理解。
    • 迭代推理:Agent根据当前的观察状态和推理结果,选择合适的工具和参数,逐步细化查询,最终生成准确的答案。
  • LLM驱动的推理:LLM作为核心,负责推理和规划。LLM根据当前的对话历史和观察结果,选择合适的工具和参数,动态调整推理策略。根据任务需求,灵活组合和使用不同的工具,构建多步骤的工具使用链,解决复杂的查询任务。

Deep Video Discovery的项目地址

  • arXiv技术论文:https://arxiv.org/pdf/2505.18079

Deep Video Discovery的应用场景

  • 教育领域:在线教育平台分析长视频课程,学生快速定位到课程中特定知识点或章节。
  • 体育赛事分析:体育赛事分析比赛视频,快速提取关键事件。
  • 视频监控:安防监控系统中,实时分析监控视频,快速识别异常行为或事件。
  • 影视制作:影视后期制作团队分析拍摄素材,快速找到所需镜头。
  • 企业会议记录:企业分析会议视频,快速提取会议要点和关键决策。

Qwen3-Coder – 阿里通义千问推出的代码生成模型

Qwen3-Coder是什么

Qwen3-Coder 是阿里通义千问团队推出的强大代码生成模型,拥有 480B 参数和 35B 激活参数,支持原生 256K token 上下文,支持扩展达到 1M token。模型在 Agentic Coding、Agentic Browser-Use 和 Agentic Tool-Use 等任务上表现卓越,达到开源模型的顶尖水平。Qwen3-Coder 基于大规模强化学习和长时序交互训练提升性能,提供命令行工具 Qwen Code 和 API 接口,方便开发者使用。Qwen3-Coder 支持助力软件开发,提升效率,降低复杂任务的人力负担。

Qwen3-Coder

Qwen3-Coder的主要功能

  • 代码生成与优化:根据用户输入的自然语言描述生成高质量的代码。支持多种编程语言,包括但不限于 Python、JavaScript、Java 等,能生成复杂的代码逻辑,如函数、类、模块等。
  • 代理式编程(Agentic Coding):自主规划和执行多步骤任务,例如在开发过程中自动调用工具、执行代码测试等。支持与外部工具(如浏览器、API 等)交互,完成复杂的任务。
  • 长时序交互(Long-Horizon Interaction):在真实世界的软件工程任务中,Qwen3-Coder 用多轮交互解决问题,例如在 SWE-Bench 等任务中表现出色。
  • 上下文扩展:原生支持 256K token 的上下文长度,基于 YaRN 技术扩展到 1M token,适用仓库级和动态数据(如 Pull Request)的处理。
  • 多工具集成:支持与多种工具(如 Qwen Code、Claude Code、Cline 等)集成。

Qwen3-Coder的技术原理

  • 混合专家模型(Mixture-of-Experts, MoE):Qwen3-Coder 是 480B 参数的混合专家模型,激活 35B 参数。支持模型在处理大规模数据时保持高效的计算性能,同时具备强大的表达能力。
  • 大规模预训练(Pre-Training):用 7.5T 的数据进行预训练,代码数据占比 70%。基于大规模数据训练,模型学习到丰富的编程模式和语言结构。支持 256K token 的上下文长度,基于 YaRN 技术扩展到 1M token,优化对仓库级和动态数据的处理能力。
  • 合成数据扩展:基于 Qwen2.5-Coder 对低质数据进行清洗和重写,显著提升整体数据质量,进一步优化模型的训练效果。
  • 强化学习(Reinforcement Learning, RL):在后训练阶段,基于大规模强化学习,通过自动扩展测试样例,构造高质量的训练实例,显著提升代码执行成功率。引入长时序强化学习(Long-Horizon RL),鼓励模型用多轮交互解决问题,提升在真实软件工程任务中的表现。

Qwen3-Coder的项目地址

  • 项目官网:https://qwenlm.github.io/blog/qwen3-coder/
  • GitHub仓库:https://github.com/QwenLM/Qwen3-Coder
  • HuggingFace模型库:https://huggingface.co/Qwen/Qwen3-Coder-480B-A35B-Instruct

Qwen3-Coder的应用场景

  • 代码生成与自动化开发:快速生成代码原型,支持多语言,节省开发时间,提升效率。
  • 代理式编程(Agentic Coding):自主规划和执行多步骤任务,与外部工具交互,完成复杂任务。
  • 软件工程任务:辅助代码审查、优化、测试生成和文档编写,提升代码质量和开发流程效率。
  • 教育与学习:为初学者提供代码示例和教学支持,助力快速掌握编程知识和技能。
  • 企业开发:快速开发内部工具、自动化脚本,提升团队效率,加速项目启动。

腾讯“AI全家桶”,集中亮相!

【导读】腾讯“AI全家桶”集中亮相世界人工智能大会,让“好用的AI”成为普惠生产力

中国基金报记者 张燕北

全球人工智能领域最具影响力的专业盛会——世界人工智能大会(WAIC)7月26日在上海开幕。

连续第八次参加大会的腾讯,今年以“让‘好用的AI’成为普惠生产力”为核心主题,携“AI全家桶”参展。其中多项技术应用“首发”“首秀”,集中展现腾讯如何凭借全自研云技术及混元大模型技术底座,让AI智能体成为14亿用户的“数字好友”,使人工智能技术沉淀为千行百业的“新质生产力”。

混元多模态AI模型矩阵集中亮相,立体呈现“从云到端”自研链路

“元宝你好,帮我看看这几个玩偶分别是哪些品牌?”“好的,这几个公仔分别是QQ企鹅公仔、Labubu和卡皮巴拉公仔……”在腾讯展台,参观者拿起手机,和腾讯元宝开启一场视频聊天。

这是腾讯元宝最新推出的视频通话功能在公开场合的“首秀”。如今,腾讯元宝能够实现更低延迟、更拟人化、更有情感的视频和语音通话。无论是老年人还是视障人士,都能随时随地向元宝提问。

而在邻近的展台,参观者们拿起画笔在平板上随意涂鸦,就能“画出”梵高、毕加索、中国水墨等风格的“AI大师画”;随机抽取关键词组合,就能根据提示词创作出三维模型。这背后是腾讯混元大模型的图像生成能力。

据了解,腾讯混元图像2.0模型支持文生图和绘画生图等多种交互方式。输入文字指令或上传本地图片、在线绘图,甚至只要一句话,就能毫秒级获得高质感图像。

如今,腾讯混元模型矩阵涵盖了文字、声音、图像、视频、3D等多种模态的生成与理解能力。其中,混元3D AI创作引擎是业界首个一站式、低门槛3D内容生产的AI创作工具,能大幅提升3D内容创作效率。

打造“AI好友圈”,让每个人成为“超级个体”

用AI答疑解惑、制作攻略、高效办公……本届WAIC中,腾讯“AI全家桶”集中亮相,扮演“生活全能家”“职场小秘书”“出行规划师”“内容创想家”等多重角色,为用户打造“AI好友圈”。目前,腾讯各项业务已全面拥抱AI,基于混元大模型等能力,将AI能力通过社交平台延伸至生活、工作、学习、出行、娱乐等多重场景,帮助人们预见未来生活的无限可能。

作为覆盖数亿用户的数字社交平台,微信与QQ延伸出更温暖的“AI智能触角”,成为用户手中的智能“好友”。如今,小程序、搜一搜、微信读书等微信开放生态已全面接入AI能力。微信用户还可以添加元宝AI助手为专属好友,拥有触手可及的“AI伙伴”。此外,微信免费提供AI学习平台——小程序教育平台,帮助中小学师生简单实现“做中学”,使用AI能力编程,学习如何解决实际问题,激发学习动力。短短一年,师生们已借助13万个不同的小程序项目,使生活和学习更加便捷高效。

基于AI大模型,QQ在聊天对话、搜索、照片及视频处理、社群管理等社交链路和社交场景中,也提供了多元化能力。QQ用户可以通过添加AI助手“小Q”为好友,体验即问即答、画图、写作、解题和文件解析等功能。此外,在“QQ AI妙绘”功能中,用户可以上传图片,智能转换为各种风格,甚至一键转化为视频,并即刻分享到QQ空间或群聊,这也是社交生态与AI结合的独特魅力。

“我们以用户需求为锚点,以使用场景为标尺,期待AI能力能够覆盖到大众日常生活的每个角落,让14亿用户体验‘添加微信好友般’的便捷,拥有触手可及的‘AI伙伴’,构建专属‘AI好友圈’,助力每个人成为AI赋能的‘超级个体’。”腾讯华东总部总经理李侃说。

五大AI生产力平台,打通AI产业应用“最后一公里”

AI技术的发展,不仅点亮了千家万户的智慧生活,也点燃了产业效率变革的引擎。本次展会,腾讯带来五大AI生产力平台:智能体开发平台、具身智能开放平台Tairos、AIGC内容生成平台、端侧大模型平台、AI教育平台,推动AI技术转化为触手可及的生产力工具。

针对企业拥抱AI面临的开发门槛高、专业知识缺、部署落地慢等困境,“腾讯云智能体开发平台”和“腾讯元器”两大智能体开发平台,大大降低AI Agent搭建与使用的门槛,帮助企业客户和创作者安全、高效、便捷地搭建属于自己的智能体。企业级知识管理工具——乐享知识库,帮助超30万家企业打造知识型组织,实现更高效、更智能的知识管理。作为腾讯广告专为营销场景打造的商业AI解决方案,“奇妙数字人”为企业提供多样化、高拟真的数字人体验,目前已储备超3000个公共数字人形象,在电商、教育、金融、大健康等多个行业中落地应用,商家直播成本最高降低90%以上。

豌豆羊输入法 – AI输入工具,支持动态预测与智能纠错

豌豆羊输入法是什么

豌豆羊输入法是专为年轻人设计的趣味AI输入法工具,由蚂蚁云通(上海)信息技术有限公司开发。通过多种创新功能,满足用户在聊天场景中的个性化和趣味化表达需求。主要功能包括智能回复、表情包制作和多样化的输入方式。用户可以用AI智能替身回复聊天,选择多种AI人设(如情话、怼人、夸赞等),能通过AI生图能力制作搞怪表情包。豌豆羊输入法支持拼音、手写、语音等多种输入方式,提供智能纠错和动态预测功能,让输入更高效。支持个性化设置,用户可以根据聊天场景切换角色和主题,打造专属输入体验。

豌豆羊输入法

豌豆羊输入法的主要功能

  • AI智能替身:接入大模型,用户上传聊天截图后,AI可自动回复,提供多种AI人设(如情话、怼人、夸赞、宫斗等),满足不同社交场景需求。
  • 智能纠错与预测:支持动态预测、整句输入,能智能纠错,让用户输入更高效。
  • AI生图能力:提供丰富的表情包制作工具,支持AI配梗、AI重绘,用户可一键生成搞怪表情包,轻松应对各种聊天场景。
  • 多种输入法:支持拼音、手写、语音、笔画、五笔等多种输入方式,满足不同用户的输入习惯。
  • 混合输入:支持中文、英文、数字、符号的混合输入免切换,方便快捷。
  • 自定义角色切换:用户可以根据聊天场景自定义角色和设定,切换输入法主题,打造专属输入体验。
  • 主题管理:提供丰富的主题选择,用户可以根据喜好更换输入法界面风格。

豌豆羊输入法的官网地址

  • 官方应用商店:豌豆羊输入法

豌豆羊输入法的应用场景

  • 社交聊天:在聊天中,用户可以通过上传聊天截图,让AI根据聊天内容生成合适的回复。
  • 高效输入:支持中英文、数字、符号的混合输入免切换,适合在学习和工作中快速输入各种内容。
  • 个性化表达:在学习和工作中,用户也可以通过自定义角色切换和主题管理,让输入法更符合自己的风格,提高输入的愉悦感。
  • 表情包制作:用户可以根据聊天内容,用AI生图能力制作搞怪表情包。