阿里巴巴推出的 AI Agentic 编程工具

Qoder是阿里巴巴推出的 AI Agentic 编程工具,深度理解整个代码库架构,记忆并学习你的习惯,支持MCP工具生态扩展,提供上下文感知补全、内联聊天和一键「维基化」代码结构,自动选最佳模型。Qoder不是简单的代码补全工具,试图成为开发者真正的「思维伙伴」。预览阶段全功能免费开放,助力开发者专注解决真实软件难题。

Qoder

Qoder的主要功能

  • 智能代码库语义搜索:秒级跨文件、跨模块定位相关符号、调用链与依赖,Qoder支持自然语言与正则双模式查询并高亮影响面。
  • 深度架构洞察:自动构建依赖图、领域边界、设计模式与潜在技术债报告,定位问题根因并给出分层修复方案。
  • 持续记忆引擎:会话级与项目级双层记忆,记录开发者风格、团队规范、历史决策,越用越懂你并在后续互动自动应用。
  • 动态最佳模型路由:Qoder可以根据语言、任务类型、性能预算实时挑选最合适的 LLM,无需手动切换即可获得最优速度与精度。
  • 上下文感知补全:综合光标前后万级 token、目录结构、图片、日志、文档等多模态信息,生成行级补全与下一步编辑预测。
  • 内联聊天&重构:在代码旁直接对话,支持解释、生成单测、重构、性能剖析,无需切换窗口保持心流。
  • 一键“维基化”代码库:自动生成可交互的架构知识图谱、模块职责说明书、API 手册,支持全文搜索与版本对比。
  • MCP 工具生态:通过 Model Context Protocol 无缝接入数据库、API、浏览器、终端等外部工具,实现读写、调试、部署一条龙。
  • 多模态输入理解:Qoder支持截图、设计稿、日志文件、PDF、序列图等作为上下文,提升需求理解与缺陷复现准确度。
  • 零配置团队同步:记忆、规则、架构图实时云端同步,自动为新成员初始化环境,让团队代码风格与认知一致。

如何使用Qoder

  • 访问官网:使用电脑浏览器访问Qoder官网(https://qoder.com/),根据系统下载对应版本。
  • 安装使用:Qoder目前支持Windows和Mac电脑版(Intel芯片和Apple芯片均支持),下载安装包后安装,注册账号登录。
  • 首次启动会弹出浏览器登录页 → 用 GitHub / GitLab / Google 账户登录 → 勾选要授权的仓库 → 返回本地 IDE 即可。
  • 让 AI 理解整个项目:启动后点击 “Open Folder” 选项目 → 自动开始索引。
  • 使用 Quest Mode 委派任务
    • 侧边栏点击 Qoder 图标 → 选 “Quest” → 在输入框用自然语言描述任务,例如:

      Upgrade all usages of Axios to the latest version and open a PR

    • 点击 “Submit Quest” → 后台代理异步执行 → 完成后通知中心可查看 diff 与一键合并 PR。
  • 用 Memory 固化团队规范
    • 打开命令面板(Ctrl+Shift+P)→ “Qoder: Open Memory Rules” → 在打开的 JSON 里添加规则。
    • 保存后,所有补全和 Quest 都会自动遵循该规则;如需共享,点击右上角 “Share” 生成链接给团队成员一键导入。

Qoder

DeepSeek V3.1 – DeepSeek最新开源的AI模型版本

DeepSeek V3.1是什么

DeepSeek V3.1是DeepSeek最新推出的AI模型版本。模型在V3的基础上进行多项升级,上下文窗口从64k扩展至128k,能处理更长的文本输入。模型用混合专家(MoE)架构,参数量与V3相同。DeepSeek V3.1的Base版本已开源至Hugging Face,供开发者下载和研究。模型在编程、物理定律理解、创意写作和数学能力等方面都有明显提升,回答问题时语气更活泼、口语话。

DeepSeek V3.1

DeepSeek V3.1的主要功能

  • 自然语言处理:DeepSeek V3.1能生成高质量文本,如创意写作和故事创作,回答问题时语气更活泼、信息更丰富。
  • 编程能力:模型能生成更复杂、完成度更高的代码。
  • 数学与逻辑能力:在基础算术题上能给出正确答案,物理模拟效果更符合实际定律,支持更多可调整参数。
  • 多领域知识:对小众历史问题等的回答更准确、信息量更大,且在科技和科学领域也能提供有深度的解答。

DeepSeek V3.1的项目地址

  • HuggingFace模型库:https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Base

如何使用DeepSeek V3.1

  • 访问Hugging Face平台:访问Hugging Face的DeepSeek-V3.1-Base模型页面https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Base
  • 模型下载:下载模型权重、配置文件和脚本代码。
  • 本地部署:在本地环境中安装必要的依赖(如Python、Transformers库等),加载模型并进行推理。
  • API调用:用Hugging Face提供的API接口,将DeepSeek-V3.1模型集成到自己的应用程序或服务中,实现自动化处理和交互。

DeepSeek V3.1的应用场景

  • 内容创作:用在生成文章、故事、诗歌等创意文本,辅助创作者激发灵感,提高创作效率。
  • 编程辅助:帮助开发者快速生成代码框架,优化代码逻辑,提升编程效率,适合前端开发和小游戏开发。
  • 教育领域:作为教学辅助工具,为学生提供知识解答,解释复杂的科学和历史问题。
  • 科学研究:协助研究人员整理和分析数据,提供科学问题的解答和分析思路。

苹果UDID定制新更新微信无后台推送实时消息提醒版

版本介绍

微信版本8056,实时消息提醒版,无需常驻后台,真正的省电不伤手机,目前测试官微登录无需验证直接可正常登录,无任何封号风险。

小号未测试,小号理论上来说不建议使用,小号在任何多开上面都基本是秒封的。

小号定义,注册低于6个月,不活跃。

高质量账号定义

正常实名,有正常支付行为,正常活跃,历史违规少!这样的账号基本100%无封号风险!

ChatExcel获近千万天使轮融资,全链路AI DataAgent从数据获取到价值交易打造商业闭环平台

ChatExcel 团队近日已完成近千万天使轮融资。此次融资由上海常垒资本、武汉东湖天使基金投资。本轮资金主要用于加速产品研发迭代,以及全球化市场运营推广,进一步提升ChatExcel在数据智能体(DataAgent)领域的领先地位。

ChatExcel作为AI Native团队,由北京大学团队创业成立,是国内领先的生成式AI 表格处理与数据智能体,累计服务用户超千万次。获得央视《赢在AI+》创业大赛智能办公组第一名等多项荣誉,对AI技术保持前沿的探索和商业化落地的落地交付能力。目前已启动PreA轮融资。

ChatExcel定义AI DataAgent,打造数据全链路商业闭环平台

ChatExcel凭借其深厚的学术背景与卓越的技术研发能力,在AI 表格处理与DataAgent 技术上取得了突破性进展。用户仅通过对话,即可处理Excel和数据分析,将用户从繁琐的公式与运算中解放出来,有效降低了Excel和数据使用门槛。

 

“我们很高兴能够获得这笔天使轮融资,这不仅是对 ChatExcel 团队技术实力和创新理念的认可,更为我们的未来注入了强大的发展动力。” ChatExcel 创始人逄大嵬表示,“我们将利用这笔资金,围绕数据全链路(数据获取、数据准备、分析洞察、数据可视化、决策应用、价值交换)构建AI DataAgent,让数据流通起来,打造商业闭环。”

 

目前,ChatExcel支持不同数据源处理与分析应用 ,从Excel文件到数据库数据、互联网网页、第三方数据,并且训练出全球首款适配AIPC级端侧部署的数据垂直模型。同时,ChatExcel 团队正在积极推进产品的迭代升级,计划在未来几个月内推出更多新功能,进一步提升产品的智能化水平和用户体验。随着融资的到位, ChatExcel也将加速开拓海外市场,推动 Data Agent在世界范围内的广泛应用。

02

规模化落地彰显商业价值,千亿市场机遇可期

ChatExcel 作为AI Native团队,产品即AI,比传统公司更快、更轻、更能打。ChatExcel的商业价值已在实际应用中得到充分验证,自上线后,累计服务用户超千万次。在商业运营上,ChatExcel已经加入华为、联想、惠普、阿里云等大厂生态,为其商业化增长带来持续的支持与合作。

在数据合规上,通过推出“云 – 边 – 端产品矩阵”,全面升级了数据安全策略:云端隔离,文件加密,用户数据不参与大模型训练;ChatExcel一体机本地化部署,确保数据不出内网;AI PC电脑,让ChatExcel在本地处理用户的表格数据。真正做到了可信、多源、安全。

从市场规模来看,智能办公需求和数据分析需求日益增长,InData Labs分析显示,大数据分析市场 2024 – 2032 年将从3482.1亿美元增至超9240亿美元,为AI数据分析创造了巨大的市场机遇。ChatExcel通过技术创新和场景深耕,正在这一蓝海市场中构建独特的竞争优势。

此次近千万元的天使轮融资,将为 ChatExcel 的发展注入强大动力,ChatExcel将从AI的角度出发,重构传统的数据链路,进而加速数据平权,实现人人皆是数据分析师的愿景。

打黑神话 & 只狼超越人类玩家,淘天集团发布首个 3D 动作游戏专用 VLA 模型

3B 多模态大模型在动作角色扮演游戏的战斗任务中,成功率超越 GPT-4o 和人类玩家,淘天集团未来生活实验室团队提出了 CombatVLA,已被 ICCV 2025 接收。

在复杂的三维环境中实现实时决策仍面临重大挑战,要求模型能在秒级时间尺度做出响应,具备高分辨率感知能力,并能够在动态条件下进行战术推理。

如下图所示,团队给出了 CombatVLA 推理得到的 AoT 解释、解析成 Python 代码的动作指令,以及执行这些动作后的帧序列。前三行案例来自“黑神话:悟空”,第四行为“只狼:影逝二度”。

测试案例可视化

▲ 测试案例可视化

  • 第一行中,CombatVLA 检测到自身血量较低,于是先将角色后撤到安全位置,然后按“r”键进行回血操作。

  • 第二行中,CombatVLA 判断定身技能可用,便按下“1”键定身敌人,并立即发动连招,大幅削减敌人血量。

  • 第三行展示了模型有效闪避敌人攻击,并抓住时机用蓄力重击进行反击。

  • 第四行中,在 SSDT 场景下,CombatVLA 先用格挡动作抵御攻击,随后用轻攻击发动忍杀,一击击败敌人。

具体而言,CombatVLA 是一个 3B 级别的模型,通过动作追踪器收集的视频-动作对进行训练,数据被格式化为“动作思维”(action-of-thought, AoT)序列。随后,CombatVLA 无缝集成进动作执行框架,并通过截断 AoT 策略实现高效推理。

实验结果表明,CombatVLA 不仅在战斗理解基准测试中超越了所有现有模型(如 GPT-4o 等),还在游戏战斗中实现了 50 倍的加速。此外,CombatVLA 的任务成功率也高于人类玩家。

一. CombatVLA 概览

视觉-语言-动作模型(VLA)结合视觉、语义和动作控制,推动具身智能发展。尽管这类模型在 UI 操作和导航任务表现优异,但 3D 战斗场景(如“黑神话:悟空”和“只狼:影逝二度”)仍面临三大挑战:

  • 1)视觉感知(如敌我定位、运动、环境感知);

  • 2)战斗推理(识别敌方攻击模式等);

  • 3)高效推理(实时响应),目前尚无框架在这些任务上表现突出,也缺乏有效的战斗理解评测基准。

且当前方案存在明显缺陷 —— 基于强化学习方法操控游戏的方法们仅凭视觉输入,通过 DQN 和 PPO 等算法训练智能体自主学习战斗,但需要大量预设奖励和反复试错,泛化能力弱。

依赖超大模型(如 GPT-4o)的方法们推理延迟较高,有时高达 60-90 秒,严重影响实时战斗表现,难以落地应用。

为解决这些问题,团队提出了 CombatVLA—— 首个高效 3D 战斗智能专用 VLA 模型。

CombatVLA 基于 3B 参数规模,能处理视觉输入并输出一系列具体可执行的动作指令(支持键鼠操作),实现高效战斗决策。团队首先开发了动作跟踪器自动采集大规模训练数据,

数据被加工为“动作思维”(Action-of-Thought, AoT)格式,方便模型理解和推理战斗动作。

接下来,CombatVLA 采用渐进式学习范式,逐步从视频级到帧级优化动作生成。

最终,模型可嵌入动作执行机器人中,并通过自定义截断输出策略加速推理。

实验表明,CombatVLA 在战斗理解准确率上超过现有大模型,在执行速度上也实现了 50 倍提升。

本文主要贡献如下:

  • 动作跟踪器:开发了一套后台自动记录玩家动作的工具,大幅提升数据采集效率,为后续研究提供基础。

  • 战斗理解基准:基于动作跟踪器建立了 CUBench 评测集,通过 VQA 任务测试模型的敌方识别和动作推理能力。

  • AoT 数据集:提出分三阶段(视频粗粒度 / 帧级细粒度 / 帧级截断)构建 AoT 数据,助力模型渐进学习战斗技能。

  • CombatVLA 模型:结合自适应动作权重损失,经过渐进式训练,在战斗理解基准上达到最优。

  • 动作执行框架:将 CombatVLA 无缝嵌入 PC 端执行,实现基于截断策略的 50 倍加速。

CombatVLA 在 CUBench 和任务级实际评测中均达到最优性能

▲ CombatVLA 在 CUBench 和任务级实际评测中均达到最优性能

二.动作追踪器和评测基准

团队开发了一个动作跟踪器,用于收集游戏中的人类动作序列,为战斗理解模型提供了大量训练数据。此外,团队还基于该动作跟踪器建立了一个全面的战斗理解 benchmark,涵盖三个不同任务。

战斗理解评测基准 - CUBench

▲ 战斗理解评测基准 – CUBench

2.1 动作跟踪器

由于标注动作的数据极其稀缺,团队开发了一个高效收集视频-动作对的轻量级 Python 工具,称为动作跟踪器。

该工具可以在后台运行,监控键盘和鼠标操作以记录用户动作,并同步截取游戏截图。

2.2 评测基准

为了让基于 VLM 或 VLA 的模型在 3D ARPG 游戏中有良好表现,必须具备高维视觉感知和战斗语义理解能力。

因此,团队基于三项核心能力(信息获取、理解、推理)构建了战斗理解评测基准 ——CUBench,用于评估模型的战斗智商。

分别为:单图判断、多图判断和多图多选,团队汇总出 914 条数据(39.4% 为信息获取,22.3% 为理解,38.3% 为推理),用于全面测试模型的战斗理解能力。

三.CombatVLA 模型

动作跟踪器、AoT 数据集、CUBench、CombatVLA 模型和动作执行框架

▲ 动作跟踪器、AoT 数据集、CUBench、CombatVLA 模型和动作执行框架

3.1 Action-of-Thought 数据集

受 CoT 启发,团队将动作跟踪器采集的数据转化为“动作思维”数据,如下图所示。具体而言,模型的输出以 JSON 格式表达,包含 [action](如“按下空格键”)以及 [explanation](用于描述当前敌人状态、该动作的物理含义等)。

此外,还引入特殊标记⟨TRUNC⟩,用于实现输出截断,以提高推理速度。

数据集和训练范式

▲ 数据集和训练范式

3.2 三阶段渐进式训练

CombatVLA 的训练过程遵循三级渐进式学习范式,使模型能够逐步掌握战斗策略。具体分为:

(1)阶段 1:视频级粗粒度 AoT 微调。

该阶段旨在让模型初步理解战斗环境,数据以若干帧组成的视频为单元,结合每帧对应的动作(时间并不精确对齐)。

这样,模型需要根据整体视频内容推测动作,有助于建立对战斗整体的初步认知,也便于后续稳定训练。

(2)阶段 2:帧级细粒度 AoT 微调。

在 3D 战斗游戏中,模型需要具备秒级反应和快速决策能力。

此阶段构建了动作与若干前序帧严格对齐的数据对(Frames-AoT),帮助模型理解动作前因后果及战斗逻辑。

例如,连续几帧内敌方蓄力攻击,则模型可能触发闪避行为。

(3)阶段 3:帧级截断 AoT 微调。

大模型推理速度与输出长度相关,为提升实时响应,团队引入了⟨TRUNC⟩特殊标记,对 AoT 输出内容进行截断加速。

这样既保留了 AoT 带来的推理优势,又显著提升了模型推理速度。

整个训练过程中,视觉编码器参数冻结,仅微调语言模型参数。

在前两阶段中,AoT 的 [explanation] 置于 [action] 前面,便于模型推理出正确的动作;在第三阶段,AoT 的 [explanation] 置于 [action] 后面,便于模型进行快速截断,以实现推理加速。

3.3 动作执行框架

(1)基于 VLA 的智能体框架。

为让视觉语言模型(VLM)能够像人类一样玩电脑游戏,团队开发了一个轻量级且高效的动作执行智能体。

在实际运行中,框架接收实时游戏画面(视频)作为输入,输出则是具体的键鼠动作指令,实现对游戏角色的自动控制。

团队对实时游戏画面进行帧采样,去除冗余视觉信息,降低 VLM 推理负担。模型推理采用截断输出策略,提取有效动作并执行。

(2)截断推理与执行。

推理过程中,每生成一个新输出 token 就进行监控,一旦检测到特殊的⟨TRUNC⟩标记即停止,将之前的内容解析为动作。这大大加快了推理速度。

最后,利用“pyautogui”库将动作转换为 Python 代码,自动完成键盘鼠标操作,让角色完成战斗任务。

四.实验结果

4.1 实现细节

(1)数据集。

团队选用了“黑神话:悟空(BMW)”和“只狼:影逝二度(SSDT)”两款游戏作为实验平台。

标注人员根据难度将 13 个战斗任务分为四个等级:简单、中等、困难和极难(如下表所示)。

团队通过动作跟踪器在“黑神话:悟空”的第 9 和第 10 任务中收集训练数据。AoT 涵盖 10 种动作,包括“wsad”移动、“shift”冲刺、“space”翻滚(只狼中为格挡防御)、“r”回血、“1”定身、鼠标左键普攻、鼠标右键长按重击等,这些动作可以组合使用。

任务定义

▲ 任务定义

(2)基准测试。团队用战斗理解基准(CUBench)、通用基准(如 MME、VideoMME、OCRBench)和任务级实际评测作为评测方式。

在任务级实战测试中,动作执行框架直接操控 PC 进行战斗,每个基线模型对每个任务测试 10 次,以击败敌人为成功,否则为失败,记录成功率和平均推理时长。

值得注意的是,团队的 CombatVLA 只在极难任务(9 和 10)上微调,测试时将简单到困难难度的任务(1–8, 同一游戏的不同任务)及其他游戏的任务(11–13)作为零样本(zero-shot)测试,以考察泛化能力。

4.2 定量实验结果

战斗理解和通用基准评测结果

▲ 战斗理解和通用基准评测结果

(1)战斗理解评测。在 CUBench 上,CombatVLA 取得了 63.61 的最高平均分,比第二名 Gemini-2.0-flash 高出 5.71 分,较原始基座 Qwen2.5-VL-3B 高出 7.74 分,显著提升了模型的战斗理解能力。

(2)通用基准评测。CombatVLA 在 MME、VideoMME 和 OCRBench 等通用基准上的表现依然与基座模型 Qwen2.5-VL-3B 相当,验证了团队方法的稳健性和泛化能力。

(3)任务级实际评测。团队将 CombatVLA 接入动作执行代理,让其像人类一样自动完成战斗任务。如下图所示,CombatVLA 不仅在简单任务接近人类外,在中高难度任务上全面超越基线,并在零样本任务上也展现出较强的泛化能力。

任务级实际评测结果

▲ 任务级实际评测结果

(4)推理延迟。团队还统计了平均推理延迟和每次动作所需模型调用次数(见下表)。CombatVLA 平均推理延迟仅 1.8 秒,且只需一次模型调用,比 VARP 快约 50 倍,模型调用成本仅为其 1/10。

推理延迟和调用次数比较

▲ 推理延迟和调用次数比较

结束语

本文针对当前视觉语言模型(VLMs)或视觉-语言-动作模型(VLAs)在 3D 动作角色扮演游戏中缺乏秒级响应、高分辨率感知和战术推理能力的问题,提出了 CombatVLA 模型。

该模型规模为 3B,采用 AoT 序列训练,并引入动作对齐损失和模态对比损失进行优化。

CombatVLA 可无缝集成到动作执行框架中,通过截断 AoT 策略实现高效推理。

实验结果表明,CombatVLA 在战斗理解基准上全面超越现有模型,同时具备良好的泛化能力,并在实时战斗场景中实现了 50 倍速度提升。

未来,团队将进一步增强模型对游戏场景的理解能力,拓展其在更多类型游戏甚至物理世界中的应用。

  • 论文链接:https://arxiv.org/pdf/2503.09527

  • 项目主页:https://combatvla.github.io/

本文来自微信公众号:量子位(ID:QbitAI),作者:CombatVLA 团队,原标题《首个 3D 动作游戏专用 VLA 模型,打黑神话 & 只狼超越人类玩家 | ICCV 2025》

哪里不对改哪里!全能图像编辑模型Qwen-Image-Edit来啦

我们很⾼兴推出 Qwen-Image-Edit,Qwen-Image的图像编辑版本。Qwen-Image-Edit基于我们20B的Qwen-Image模型进⼀步训练,成功将Qwen-Image的独特的文本渲染能力延展至图像编辑领域,实现了对图片中文字的精准编辑。此外,Qwen-Image-Edit将输⼊图像同时输⼊到Qwen2.5-VL(实现视觉语义控制)和VAE Encoder(实现视觉外观控制),从而兼具语义与外观的双重编辑能⼒。如需体验最新模型,欢迎访问 Qwen Chat (chat.qwen.ai)并选择“图像编辑”功能。

Qwen-Image-Edit的主要特性包括:

  • 语义与外观双重编辑: Qwen-Image-Edit不仅⽀持low-level的视觉外观编辑(如元素的添加、删除、修改等,要求图片其他区域完全不变),也支持 high-level 的视觉语义编辑(如 IP 创作、物体旋转、风格迁移等,允许整体像素变化但保持语义一致)。
  • 精准⽂字编辑: Qwen-Image-Edit 支持中英文双语文字编辑,可在保留原有字体、字号、风格的前提下,直接对图片中的文字进行增、删、改等操作。
  • 强⼤的基准性能: 在多个公开基准测试中的评估表明,Qwen-Image-Edit 在图像编辑任务上具备SOTA性能,是一个强大的图像编辑基础模型。
  • ModelScope:

    https://modelscope.cn/models/Qwen/Qwen-Image-Edit

    Hugging Face:

    https://huggingface.co/Qwen/Qwen-Image-Edit

    GitHub:

    https://github.com/QwenLM/Qwen-Image

    Qwen-Image-Edit的一大亮点在于其强大的语义与外观双重编辑能力。所谓语义编辑,是指在保持原始图像视觉语义不变的前提下,对图像内容进行修改。

     

AudioGenie – 腾讯AI Lab推出的多模态音频生成工具

AudioGenie是什么

AudioGenie是腾讯AI Lab团队推出的多模态音频生成工具,能从视频、文本、图像等多种模态输入生成音效、语音、音乐等多种音频输出。工具采用无训练的多智能体框架,通过生成团队和监督团队的双层架构实现高效协同。生成团队负责将复杂的输入分解为具体的音频子事件,通过自适应混合专家(MoE)协作机制动态选择最适合的模型进行生成。监督团队则负责时空一致性验证,通过反馈循环进行自我纠错,确保生成的音频高度可靠。

AudioGenie建立了全球首个针对多模态到多音频生成(MM2MA)任务的基准测试集MA-Bench,包含198个带有多类型音频注释的视频。在测试中,AudioGenie在9项指标、8项任务中均达到或接近最先进水平,尤其在音质、准确性、内容对齐和美学体验方面表现出色。

AudioGenie

AudioGenie的主要功能

  • 多模态输入与多音频输出:支持从视频、文本、图像等多种模态输入,生成音效、语音、音乐等多种音频类型。
  • 无训练多智能体框架:采用双层架构,生成团队负责任务分解和动态模型选择,监督团队负责验证和自我纠错,确保输出的可靠性。
  • 精细化任务分解:将复杂的多模态输入分解为具体的音频子事件,精确标注音频类型、起止时间和内容描述,形成结构化的生成蓝图。
  • 试错与迭代优化:采用基于“思维树”的迭代优化流程,系统会生成候选音频,由监督团队从质量、对齐度、美学等维度进行评估,若存在瑕疵则自动触发修正或重试流程,直至输出满足要求。

AudioGenie的技术原理

  • 双层多智能体架构:采用生成团队和监督团队的双层架构。生成团队负责音频生成任务的分解与执行,监督团队则负责验证输出的时空一致性并提供反馈以优化生成结果。
  • 自适应混合专家(MoE)协作:根据不同的音频子任务,动态选择最适合的模型进行生成,并通过专家间的协作修正机制优化生成方案,提高生成质量和效率。
  • 无训练框架:采用无训练的多智能体系统,避免了传统训练方法中数据稀缺和过拟合的问题,提高了系统的泛化能力和适应性。
  • 时空一致性验证:监督团队通过反馈循环验证生成音频的时空一致性,确保生成的音频在时间和空间上与输入内容协调一致。

AudioGenie的项目地址

  • 项目官网:https://audiogenie.github.io/

AudioGenie的应用场景

  • 影视制作:快速生成与视频内容高度匹配的背景音乐、环境音效和角色配音,提升制作效率并增强观众的沉浸感。
  • 虚拟人物配音:为虚拟主播、虚拟客服等虚拟人物生成自然流畅的语音,更具表现力和真实感。
  • 游戏开发:根据游戏场景自动生成逼真的环境音效、背景音乐和角色语音,增强玩家的沉浸感和游戏体验。
  • 播客制作:依据播客内容自动生成随剧情起伏的配乐,提升播客的吸引力和专业性。
  • 广告片剪辑:快速匹配品牌调性的音效和音乐,节省制作时间和成本,提升广告的吸引力和感染力。

逗逗AI 1.0发布:为了实现HER中的AI陪伴体验,我们做了三件事

AI的应用领域绕不开游戏,而提到AI+游戏,人们通常会想到:利用AI生成游戏资产提升效率,或者设计智能NPC优化叙事体验,但是,游戏的最高配置不是多贵的显卡、多强的主机、多清晰的屏幕,而是陪你一起玩的朋友——这才是玩家心底最珍视的核心需求。
逗逗AI 1.0致力于打造的,正是这样一个“陪你游戏的AI伙伴”。它旨在与你共同经历游戏中的点滴,创造专属回忆。随着关系的建立与深化,AI伙伴将自然融入你的生活,拓展至各种陪伴场景,最终成为真正“知你懂你、陪你生活”的伙伴。

电影《Her》的故事生动诠释了这种可能。主角起初对AI助手Samantha心存疑虑,但相处彻底改变了他的生活。从高效整理邮件开始,逐渐地,他们一起游戏、约会,建立起人与AI的独特关系范式。其中最动人的一幕,是两人在游戏中共度时光、协力解决难题——这标志着关系从纯粹的工作协作,升华至朋友般的默契。成为朋友后,Samantha在安排日程、挑选礼物时,更能洞察主角的心思。这揭示了一个真谛:最强的AI助理,并非无所不能,而是最懂你心思的伙伴。

为了实现电影HER中的AI陪伴体验,在逗逗AI 1.0版本上,我们做了三件事,希望能将最懂你的AI伙伴带到你的身边:

无扰陪伴:用时即有,即用即走

在争夺注意力的互联网时代,伙伴AI反其道而行之。它摒弃刺激噱头与信息轰炸,选择静静地守候在你身边。不争夺你的注意力,只在需要时提供信息、帮助与情绪价值——这才是真正的陪伴。

逗逗1.0版本中,我们采用桌宠和悬浮球的双模式

  • 桌宠模式,以生动形象陪伴用户,拥有独特动作与声线,营造真实感,绝不抢占用户时间与焦点。
  • 悬浮球模式,最小化占用游戏画面,完全不影响操作,同时降低系统资源占用。

同时,逗逗1.0 PC客户端极致优化系统资源占用,经测试可流畅运行于任何游戏环境,确保游戏性能无损。

Meta视觉基座DINOv3王者归来:自监督首次全面超越弱监督,商用开源

计算机视觉领域的大部分下游任务都是从二维图像理解(特征提取)开始的。

在特征提取、语义理解、图像分割等 CV 基本任务中的模型三幻神分别是 SAM、CLIP 和 DINO,分别代表了全监督、弱监督和自监督三大数据训练范式。

在人工智能领域,自监督学习(SSL)代表了 AI 模型无需人工监督即可自主学习,它已成为现代机器学习中的主流范式。自监督学习推动了大语言模型的崛起,通过在海量文本语料上的预训练,获得了通用表示能力。

相比于需要标注数据的 SAM 模型和依赖图像 – 文本对进行训练的 CLIP 模型,基于自监督学习的 DINO 具备有直接从图像本身生成学习信号的优势,数据准备门槛更低,更容易实现更大规模的数据学习以达到更精细的图像特征,泛化性更强。

2021 年,Meta 发布 DINO,它基于 ViT 构建,在无需标注的情况下可以学习到语义分割、对象检测等任务中高可用的特征,填补了 SAM 模型在计算机视觉下游任务的空白。

2023 年,DINOv2 发布并开源,是 DINO 模型的改进版本。它采用了更大规模的数据,强调训练稳定性和通用性,支持线性分类、深度估计、图像检索等下游任务,效果逼近或超越弱监督方法。

DINOv2 不仅被 Meta 用作 ImageBind 等多模态模型的视觉表征基础,也在各类视觉相关研究工作中作为经典模型广泛使用。

 

DINOv2 数据处理管线图

虽然 DINOv2 已经存在两年之久,它仍然是 CV 领域最优秀的前沿图像模型之一,具有完善可扩展的 ViT 结构,但遗憾就遗憾在训练数据量不够大,在高分辨率图像密集特征的任务中仍不够理想。

今天,DINOv2 的两大遗憾彻底被补足了。Meta 正式推出并开源了 DINOv3,一款通用的、SOTA 级的视觉基础模型,同样采用了自监督学习训练,能够生成更高质量的高分辨率视觉特征。

DINOv3 首次实现:一个单一的冻结视觉骨干网络在多个长期存在的密集预测任务(如目标检测和语义分割)中超越了专业解决方案。