开源SOTA:阶跃发布端到端语音大模型Step-Audio 2 mini!

大家好,今天阶跃星辰正式发布最强开源端到端语音大模型 Step-Audio 2 mini,该模型在多个国际基准测试集上取得 SOTA 成绩

它将语音理解、音频推理与生成统一建模,在音频理解、语音识别、跨语种翻译、情感与副语言解析、语音对话等任务中表现突出,并率先支持语音原生的 Tool Calling 能力,可实现联网搜索等操作。

一句话总结,Step-Audio 2 mini “听得清楚、想得明白、说得自然”。模型现已上线 GitHub、Hugging Face 等平台,欢迎大家下载、试用并反馈。

  • GitHub:https://github.com/stepfun-ai/Step-Audio2
  • Hugging Face:https://huggingface.co/stepfun-ai/Step-Audio-2-mini
  • ModelScope:https://www.modelscope.cn/models/stepfun-ai/Step-Audio-2-mini

性能 SOTA

Step-Audio 2 mini 在多个关键基准测试中取得 SOTA 成绩,在音频理解、语音识别、翻译和对话场景中表现突出,综合性能超越 Qwen-Omni 、Kimi-Audio 在内的所有开源端到端语音模型,并在大部分任务上超越 GPT-4o Audio。

  • 在通用多模态音频理解测试集 MMAU 上,Step-Audio 2 mini 以 73.2 的得分位列开源端到端语音模型榜首;
  • 在衡量口语对话能力的 URO Bench 上, Step-Audio 2 mini 在基础与专业赛道均拿下开源端到端语音模型最高分,展现出优秀的对话理解与表达能力;
  • 在中英互译任务上, Step-Audio 2 mini 优势明显,在 CoVoST 2 和 CVSS 评测集上分别取得 39.3 和 29.1 的分数,大幅领先 GPT-4o Audio 和其他开源语音模型;
  • 在语音识别任务上,Step-Audio 2 mini 取得多语言和多方言第一。其中开源中文测试集平均 CER(字错误率) 3.19,开源英语测试集平均 WER(词错误率) 3.50,领先其他开源模型 15% 以上。
论文链接:https://arxiv.org/abs/2507.16632

真端到端架构,轻松听懂“弦外之音”

过往的 AI 语音常被吐槽智商、情商双低。一是“没知识”,缺乏文本大模型一样的知识储备和推理能力;二是“冷冰冰”,听不懂潜台词,语气、情绪、笑声这些“弦外之音”。Step-Audio 2 mini 通过创新架构设计,有效解决了此前语音模型存在的问题,做到“走脑又走心”。

  • 真端到端多模态架构:Step-Audio 2 mini 突破传统 ASR+LLM+TTS 三级结构,实现原始音频输入到语音响应输出的直接转换,架构更简洁、时延更低,并能有效理解副语言信息与非人声信号。

图:Step-Audio 2 mini 模型架构图

  • CoT 推理结合强化学习:Step-Audio 2 mini 在端到端语音模型中首次引入链式思维推理(Chain-of-Thought, CoT)与强化学习联合优化,能对情绪、语调、音乐等副语言和非语音信号进行精细理解、推理并自然回应。
  • 音频知识增强模型支持包括 web 检索等外部工具,有助于模型解决幻觉问题,并赋予模型在多场景扩展上的能力。

案例分享

下面的案例生动地展示了 Step-Audio 2 的能力。无论是大自然的声音、精湛的配音,还是实时信息搜索,它都能精确理解,展现了在处理复杂音频任务上的巨大潜力。

精准识别,听懂万物之声

Step-Audio 2 mini 像一位听力超棒的音乐家,能分清鸟叫、流水、车声和发条玩具声这四种不同的“音符”。它甚至能听出汽车声中的“激情”——引擎加速和呼啸而过,而不只是冷冰冰地告诉你:“这是车。”

实时搜索,随时获得行业最新资讯

聊到 OpenAI 最新动态,Step-Audio 2 mini 通过工具调用搜索,迅速挖掘出最新语音模型资讯。

语速控制,轻松拿捏

此前,我们发布了同系列满血版 Step Audio 2,现已上线阶跃AI App。打开首页,点击右上角“电话”按钮,即可与模型进行实时对话,体验“深度聆听”和“多音色切换”功能。

不止对话,一起深度思考

当被问及“爱美是自由还是枷锁”这类哲学难题时,Step-Audio 2 mini 能将抽象问题转化为“购物前问自己三个问题”的极简方法论。这背后强大的逻辑推理能力,不仅能引导用户厘清思路,更能找到解决问题的具体路径。

欢迎体验

Step-Audio 2 mini 现已上线阶跃星辰开放平台,欢迎体验和反馈。

体验地址:https://realtime-console.stepfun.com

GLM-4.5编码套餐:20元包月,人人畅享全球顶级Claude Code编码体验

过去一段时间,越来越多开发者在真实编码任务中开始采用 GLM-4.5。

在前端开发、跨文件修改、全栈项目构建等典型场景中,GLM-4.5 展现出稳定、实用的表现,逐步成为不少用户的主要编程助手。

根据反馈,其解决实际问题的能力已接近 Claude Sonnet 4。在多个开源评测中,GLM-4.5 也与国际主流模型保持同等竞争力:

  • WebDev Arena:与全球领先模型并列第二;
  • SWE-bench Verified:性能优于  Gemini-2.5-Pro 和 GPT-4.1;
  • BFCL v4 基准:全球第一,超过 Claude Opus 4.1,成本仅为其 1.5%。

为进一步降低 AI 编码工具的使用门槛,我们正式推出限时 Claude Code 专属套餐「GLM Coding Plan」——月费低至 20 元,让更多用户以合理成本使用高质量的代码生成能力。

在真实 Agentic Coding 场景中展现卓越性能

为评估模型的 Agentic Coding 能力,我们构建了 CC-Bench 评测体系,并将 GLM-4.5 与 Claude Sonnet 4、DeepSeek-V3.1、Kimi-K2 和 Qwen3-Coder-480B 在覆盖六大开发领域的 52 个实际编程任务上进行了对比。所有模型在相同环境中测试,确保公平性。

CC-Bench评测体系:

https://huggingface.co/datasets/zai-org/CC-Bench-trajectories

结果显示,GLM-4.5 在开源模型中表现优异,尤其在任务完成效果和工具调用可靠性方面。GLM-4.5 在编码性能方面接近 Claude Sonnet 4,但价格仅为后者的 1/7,性价比优势显著,为开发者提供高性价比选择。

限时体验,低门槛开启高效编程

自 9 月 1 日起,我们推出「GLM Coding Plan」限时套餐,该套餐适用于智谱最新旗舰模型 GLM-4.5 及 GLM-4.5-Air。用户可通过扫描活动海报二维码,或者登录智谱开放平台 bigmodel.cn直接购买并获取详细使用攻略。

首期主推 Claude Code,未来将拓展到更多 Coding 工具。目前,GLM-4.5 已接入包括 Claude Code、Cline、Gemini CLI、Grok CLI、CodeGeeX、Kilo Code、Roo Code、Trae 在内的多款主流编程工具,全面支持日常开发流程。

同时,我们在海外站点 api.z.ai 同步推出了对应的海外套餐,满足全球开发者在多场景下的使用需求,欢迎访问了解详情。

美团正式发布并开源 LongCat-Flash-Chat,动态计算开启高效 AI 时代

今天,我们正式发布 LongCat-Flash-Chat,并同步开源。LongCat-Flash 采用创新性混合专家模型(Mixture-of-Experts, MoE)架构,总参数 560 B,激活参数 18.6B~31.3B(平均 27B),实现了计算效率与性能的双重优化。

根据多项基准测试综合评估,作为一款非思考型基础模型,LongCat-Flash-Chat 在仅激活少量参数的前提下,性能比肩当下领先的主流模型,尤其在智能体任务中具备突出优势。并且,因为面向推理效率的设计和创新,LongCat-Flash-Chat 具有明显更快的推理速度,更适合于耗时较长的复杂智能体应用。

目前,我们在 Github、Hugging Face 平台同步开源,同时你也可以访问官网 https://longcat.ai/,与 LongCat-Flash-Chat 开启对话。

技术亮点 /

LongCat-Flash 模型在架构层面引入“零计算专家(Zero-Computation Experts)”机制,总参数量 560 B,每个token 依据上下文需求仅激活 18.6B~31.3 B 参数,实现算力按需分配和高效利用。为控制总算力消耗,训练过程采用 PID 控制器实时微调专家偏置,将单 token 平均激活量稳定在约 27 B。

图1:LongCat-Flash 架构图

此外,LongCat-Flash 在层间铺设跨层通道,使 MoE 的通信和计算能很大程度上并行,极大提高了训练和推理效率。配合定制化的底层优化,LongCat-Flash 在 30 天内完成高效训练,并在 H800 上实现单用户 100+ tokens/s 的推理速度。LongCat-Flash 还对常用大模型组件和训练方式进行了改进,使用了超参迁移和模型层叠加的方式进行训练,并结合了多项策略保证训练稳定性,使得训练全程高效且顺利。

针对智能体(Agentic)能力,LongCat-Flash 自建了Agentic评测集指导数据策略,并在训练全流程进行了全面的优化,包括使用多智能体方法生成多样化高质量的轨迹数据等,实现了优异的智能体能力。

通过算法和工程层面的联合设计,LongCat-Flash 在理论上的成本和速度都大幅领先行业同等规模、甚至规模更小的模型;通过系统优化,LongCat-Flash 在 H800 上达成了 100 tokens/s 的生成速度,在保持极致生成速度的同时,输出成本低至 5元/百万 token。

性能评估 /

全面且严谨的评估表明,LongCat-Flash 是一款强大且全能的模型,它在多个领域表现出卓越的性能优势。以下将从不同维度详细解读:

图2:LongCat-Flash 的基准测试性能

  • 通用领域知识方面,LongCat-Flash 表现出强劲且全面的性能:在 ArenaHard-V2 基准测试中取得 86.50 的优异成绩,位列所有评估模型中的第二名,充分体现了其在高难度“一对一”对比中的稳健实力。在基础基准测试中仍保持高竞争力,MMLU(多任务语言理解基准)得分为 89.71,CEval(中文通用能力评估基准)得分为 90.44。这些成绩可与目前国内领先的模型比肩,且其参数规模少于 DeepSeek-V3.1、Kimi-K2 等产品,体现出较高的效率。

  • 智能体(Agentic)工具使用方面,LongCat-Flash 展现出明显优势:即便与参数规模更大的模型相比,其在 τ2-Bench(智能体工具使用基准)中的表现仍超越其他模型;在高复杂度场景下,该模型在 VitaBench(复杂场景智能体基准)中以 24.30 的得分位列第一,彰显出在复杂场景中的强大处理能力。

  • 编程方面,LongCat-Flash 展现出扎实的实力:其在 TerminalBench(终端命令行任务基准)中,以 39.51 的得分位列第二,体现出在实际智能体命令行任务中的出色熟练度;在 SWE-Bench-Verified(软件工程师能力验证基准)中得分为 60.4,具备较强竞争力。

  • 指令遵循方面,LongCat-Flash 优势显著:在 IFEval(指令遵循评估基准)中以 89.65 的得分位列第一,展现出在遵循复杂且细致指令时的卓越可靠性;此外,在 COLLIE(中文指令遵循基准)和 Meeseeks-zh(中文多场景指令基准)中也斩获最佳成绩,分别为 57.10 和 43.03,凸显其在中英文两类不同语言、不同高难度指令集上的出色驾驭能力。

模型部署 /

我们同步提供了分别基于 SGLang 和 vLLM 的两种高效部署方案,助您轻松部署、快速体验模型效果。

以下为使用SGLang进行单机部署的示例:

python3 -m sglang.launch_server \    --model meituan-longcat/LongCat-Flash-Chat-FP8 \    --trust-remote-code \    --attention-backend flashinfer \    --enable-ep-moe \    --tp 8

其他更为详细的部署指导请参阅 LongCat-Flash-Chat 仓库:

https://github.com/meituan-longcat/LongCat-Flash-Chat

全面开放,即刻体验 /

前往 https://longcat.ai/ ,立即与 LongCat-Flash-Chat 开启对话。

图片

开源平台地址:

  • Hugging Face:https://huggingface.co/meituan-longcat/LongCat-Flash-Chat

  • Github:https://github.com/meituan-longcat/LongCat-Flash-Chat

此次我们的开源仓库统一采用 MIT License,并允许用户利用模型输出、通过模型蒸馏等方式训练其他模型。

问小白5 重磅发布:国产大模型实力对标 GPT-5

我们隆重推出“All in One”旗舰模型—问小白5,我们迄今为止最智能、最快捷、最实用的AI系统,各项榜单成绩最接近 GPT-5 的标杆之作

问小白5 在智能水平上实现了重大突破,在生活、学习、金融、科技等领域提供更实用、更专业的解答。

它是一个统一的系统,能够识别何时快速响应,何时需要更长时间的思考,从而提供专家级的回答,问小白5 面向所有用户开放。

综合性能评测

AA-Index 是一个综合性的 AI 基准评估指标,通过整合数学推理、科学问答、编码与语言理解等多个维度,为全世界共228款大模型提供了统一、全面、有信度的智能能力比较参考,便于科学、公正地评估模型整体表现。

问小白5 以 64.7分 的 AA-Index 指标超过 Gemini2.5 Pro ,并成为智能水平最接近 GPT-5 的国产AI大模型。

售价2万5!英伟达推出机器人“最强大脑”:AI算力飙升750%配128GB大内存,宇树已经用上了

英伟达直接把服务器级别的算力塞进了机器人体内。

全新的机器人计算平台Jetson Thor正式发售,基于最新的Blackwell GPU架构,AI算力直接飙升到2070 TFLOPS,比上一代Jetson Orin提高至整整7.5倍,同时能效提高至3.5倍。

128GB的超大内存配置,在边缘计算设备里是前所未有。

在宣传片中,黄仁勋把他当成送给所有机器人的礼物:

黄仁勋表示:

Jetson Thor助力全球百万开发者构建可与物理世界交互、甚至改变物理世界的机器人系统。具备无与伦比的性能与能效,还能够在边缘设备上同时运行多个AI模型。

作为一款卓越的超级计算机,Jetson Thor正在推动物理AI与通用机器人时代真正到来。Jetson Thor基于Jetson软件栈优化,支持所有流行的生成式AI框架和AI推理模型,包括主流语言模型Qwen、DeepSeek以及视觉语言动作模型到和视觉语言模型等。

etson AGX THOR开发者套件美国售价3499美元(约25000人民币,但中国售价尚未公布)

T5000模组也已发售,购买1000片以上单价2999美元。

其中T5000模组是完整版,T4000模组则是为那些想从Orin升级的用户准备的精简版,功耗也从130W降到了75W。

性能爆表背后的技术细节

Thor的强悍不仅体现在AI算力上,人形机器人需要大量实时控制计算,需要CPU与AI算力同样重要,存储与带宽方面也都得到了升级。

具体特性如下:

  • GPU:Blackwell架构,最高2560个CUDA核/9个第五代Tensor Core,并支持MIG技术(多实例 GPU)将GPU资源按多任务隔离与并行调度,适配并行多代理/多工作流场景。
  • CPU:14核Arm Neoverse V3AE,面向实时控制与任务管理的确定性执行与更高吞吐,CPU性能相较前代显著提升。
  • 存储与带宽:128GB 256-bit LPDDR5X,273GB/s显存带宽,为大型Transformer推理与高并发视频编解码提供保障。
  • 功耗:40–130W,支持从移动平台到固定式机器人多样热/功耗配置,开发套件集成导热板与风扇便于热设计评估。
  • 视频编解码:多路4K/8K编解码能力显著增强,有利于多摄并发与长时视频代理推理。
  • 网络与传感:最多4×25GbE,搭配高速摄像头卸载引擎与Holoscan Sensor Bridge,将相机、雷达、激光雷达等数据以极低时延直送 GPU 内存,提升多传感器融合与高频闭环控制的稳定性。
  • I/O:开发套件与量产模组提供 QSFP28、RJ45、USB 3.x、PCIe Gen5等接口,适配机器人传感/执行器与加速外设扩展

在软件优化上,英伟达也下了功夫。

Jetson Thor原生支持NVIDIA Isaac(仿真/开发)、Isaac GR00T(人形机器人基础模型)、Metropolis(视觉 AI)、Holoscan(传感器工作流),支持从云到边缘统一开发/部署路径。

通过FP4量化和推测解码(speculative decoding)技术,在某些模型上能再获得2倍的性能提升。

数据显示,Thor能在200毫秒内给出第一个token响应,每秒能生成超过25个token,这个速度已经能支撑实时人机对话。

“杭州六小龙”又开源了!一句话爆改空间设计,AI视频生成Agent今年发

智东西8月25日报道,AI不仅能生成文章、图像和视频,还能生成可以动的室内空间设计了!
只需用文字描述3D空间,或者上传一张户型图,你就能让AI创建出一个可交互的3D室内空间。
问客厅一共几个门,AI迅速给出答案“6扇门”。你也可以上难度,一句话让它生成适合老人居住的客厅:

AI能意识到“老人居住”需要的防滑扶手以及家具摆放方式,化身虚拟室内空间设计师,直接替你把防滑扶手、桌椅、窗帘、冰箱、落地灯等都布置好了。
你还可以要求更改细节,比如加一些装饰画:

DE 国内版公测丨支持最新 DeepSeek V3.1

odeBuddy IDE 国内版正式开放公测!🚀
🌟 无需邀请码,即刻免费使用最新 DeepSeek V3.1 模型
官网下载地址(Beta 版):https://copilot.tencent.com/ide/

用 CodeBuddy,真正实现一个人变成一整个开发团队的极致提效体验,一站式产品工作台,助你规划、开发和发布应用 ⬇️

▶️ 产品设计:一句话生成可落地交互原型,支持上传图片及局部调优
▶️ 研发编码:内置 Figma,设计稿秒变可维护源码。同时,内置腾讯云开发 CloudBase、EdgeOne Pages 及 Supabase,帮助开发者自动配置数据库、用户认证等后端服务,快速构建、部署站点和无服务器应用
▶️ 部署验证:通过 CloudStudio 一键部署至沙箱环境,并生成可分享链接
(详细功能参考腾讯的 AI IDE 来了!国际版开启内测(🎁 评论送邀请码))

💡 DeepSeek-V3.1-Think 是深度求索最新发布的一款同时支持思考模式与非思考模式的混合推理模型。据官方消息,相比前一版本,本次升级在多个方面实现提升:
🆙 编程能力表现突出:社区使用 Aider 测试数据自行测试的结果显示,V3.1在开源模型中领先,在 Aider 编程基准测试中取得71.6%的分数,超越 R1 和 Claude Opus 4(no think),同时推理和响应速度更快。
🆙 更强的 Agent 能力:通过 Post-Training 优化,新模型在工具使用与智能体任务中的表现有较大提升
🆙 更高的思考效率:相比 DeepSeek-R1-0528,DeepSeek-V3.1-Think 能在更短时间内给出答案
🆙 更强的长文本能力:DeepSeek-V3.1 使用外扩阶段训练更充分的 Base 模型,增强了长文本处理能力

欢迎大家下载体验:https://copilot.tencent.com/ide/

钉钉联手通义推出Fun-ASR语音识别大模型,可听懂家居、畜牧等十大行业黑话

8 月 22 日,钉钉、通义实验室语音团队宣布,联手推出新一代语音识别大模型 Fun-ASR,能听懂家装、畜牧等十大行业黑话,并支持企业专属模型定制训练。基于双方深度共建,Fun-ASR 能够准确转写各种语音信号,具备识别多行业术语、不同语言与口音的能力,也能结合上下文信息实现更精准的转录,并支持企业专属模型定制训练,让模型更懂企业场景。目前,Fun-ASR 已被集成进钉钉的多个功能模块,包括会议字幕与同传、智能纪要、语音助手等旨在构建一套稳定、高效、易扩展的语音识别基座,尤其适用对企业级语境理解、识别准确率有较高要求的场景。

该模型经过上亿小时音频数据的训练,并结合钉钉多行业客户的真实场景共创,能够准确理解互联网、科技、家装、畜牧、汽车等十多个领域的专业术语。

实测数据显示,Fun-ASR 在保险行业的准确率较以往提升 18%,在家装、畜牧等行业也实现了 15%-20% 的提升。针对生僻词汇,Fun-ASR 还提供企业自定义热词能力,最多可支持 1000+ 热词导入。

前美团硬件负责人创业,做了一款项链式的“AI相机”|涌现NewThings

8月19日上午,在海淀区北四环的一座大厦里,我们见到了「光智时空Looki」创始人孙洋。

共享办公区的会议室里,他微笑中带着倦容,白色T恤上磁吸着一个手表大小的黑色圆盘。那是他们第二天就要全球首发的多模态AI穿戴设备:AI生活相机。

多模态AI穿戴设备是如OpenAI、苹果等巨头都在探索,却未推出的新品类,对于一家初创公司更是挑战重重。为了准备这场产品发布会,孙洋和Looki的20多名员工已经奋战数周,正处于正式“亮剑”前的紧张时刻。

不过谈起产品,孙洋却又是难以掩饰的兴奋,声量也高了一度。他向我们展示了这款AI穿戴设备的新功能:当桌子上的咖啡出现在设备摄像头的视野中,设备随即通过手机APP消息提示了这杯咖啡的咖啡因。

“这是我们最近才研究出来的杀手锏功能,我相信应该能让用户眼前一亮。”孙洋激动地说道。

一天后,Looki的首款设备Looki L1正式发布。

这是一款仅重30克的AI生活相机,既可以磁吸,也能像项链一样挂在脖子上。它能看能听,可以感知、记录和理解生活,也能结合云端大模型能力,为用户提供主动式服务。海外售价199美元,计划于2025年9月开始全球发货。

Looki L1没有屏幕,一共只有两个物理按键,可以通过长短按开启间隔录像、拍照、录像和录音功能。AI交互方面,除了Looki app主动推送各类消息以外,用户还可以主动通过L1机身正面的touchpad和设备语音交互,或是在Looki app的对话框里进行文字交互。

图片

△图源:企业授权

孙洋是前美团智能硬件负责人,也负责Looki的产品定义和开发。他的创业想法来自于在美团的工作经历。

2023年,美团内部尝试将AI大模型赋能各条业务线,孙洋负责设计一款AI外卖助手。但在执行中,他发现外卖助手无法做好向用户推荐吃什么这件事。这背后的原因并不在于模型能力不足,而在于缺少context(上下文)。

“模型上知天文下知地理,但是不知道你今天有没有喝水。正是这个鸿沟,导致AI无法提供真正个性化的推荐。”

孙洋得出结论——要让AI更好地服务于个人生活,仅数字世界远远不够,必须要掌握“原子世界”的信息,才能获得context,问题的解法则指向了硬件。

5个月后,他和前同事、美团自动驾驶前算法负责人刘博聪一起创立了Looki。

图片

△Looki创始人孙洋,图源:企业授权

不过,对于一家创业公司而言,布局AI Native硬件不能回避的一个问题是:要打造一个前所未有的新硬件品类本就困难重重,还面临着与互联网、硬件巨头之间的不对称竞争,Looki如何形成壁垒?

面对我们提出的担忧,孙洋的回答出人意料地坦诚。他直言,对于初创公司来说,“所谓的壁垒都是扯淡”。

在他看来,要在一个强敌环伺的市场上突围,只有两个可能:一是抓住非共识,打好认知差;二是要足够快,在对手都看不清楚的时候,就敢去尝试,占领先机。

Looki自去年8月开始开发首款多模态AI产品,彼时多模态模型的能力还不够完备,而Looki能够抢先发布,靠的就是“非共识”和“足够快”。孙洋也坦诚,“这个做法有一定赌的成分。”

实际上,AI大规模风起之后,离职创业入局AI硬件的大厂高管们不在少数,但像孙洋一样,选择做AI原生硬件、和巨头掰腕子的创始人则是凤毛麟角,这无疑是一场巨大的冒险。

对于第一次创业,孙洋做好了放手一搏的准备,他并不惧怕失败。

“我们内部有一句话:你可以优雅的失败。”孙洋告诉《智能涌现》。对他来说,失败不是终点,是一个逗号,一个项目的失败,能带来经验、逻辑,能打磨出一个有战斗力的团队。

以下是《智能涌现》和「光智时空Looki」创始人孙洋的对话,经编辑整理:

“要让AI更好地服务于个人生活,硬件必不可少”

《智能涌现》:你是什么时候下定决心创业的?

孙洋:我有创业想法大约是在2023下半年。当时我在美团负责做一款AI外卖助手,开发过程中,我发现外卖助手无法做好向用户推荐吃什么这件事。尽管模型的智能化有待提高,但问题的核心并不在于模型本身,而在于context(上下文)信息的缺失。

我们看到模型上知天文下知地理,但是不知道你今天吃了什么,有没有喝水。正是这个鸿沟导致AI无法提供真正个性化的推荐和服务。所以我们意识到,需要将这些缺失的信息补充完整。

一开始我们考虑从软件开发层面解决问题,但因为感知能力实际上受硬件限制。无论是手机APP还是PC网页或软件,它们所依赖的硬件本身并无感知能力,因此无法跳出这个局限。这就需要一种新的硬件来打破这种限制。

举个例子,现在我手上举了一杯咖啡,手机和PC是不知道的,这就需要一种新的硬件来感知和识别。这样硬件就可以提醒我,我看到你今天喝了两杯咖啡了,咖啡因摄入要超量了。

《智能涌现》:是怎么思考产品形态的,为什么选择了AI生活相机?

孙洋:我们首先关注的是眼镜这一形态,因为眼镜是五官中离人最近的。我们对眼镜进行了半年多的调研,但后来发现眼镜的供应链能力尚未成熟。它受到续航能力、重量以及功能的限制,不可能三者兼得。

因为我想做的是一个AI Native的事情,所以哪一个形态今天供应链最成熟,能把东西先做出来,就先选择什么形态。所以我们就选择了AI生活相机。

《智能涌现》:你们的产品思路和OpenAI要推的AI项链是不是很相似?

孙洋:我觉得大致思路和方向是一样的。Open AI之前提到说,就是想做一个生活记录的Memory Machine(记忆机器),同样是用硬件感知和记录物理世界,为AI大模型提供关键的context上下文,从而实现更深度的个性化服务。

《智能涌现》:这类AI Native设备的市场空间有多大?

孙洋:最大的机会是像OpenAI所说的,成为每个人将拥有的、手机、电脑之外的第三台设备。但这需要几年的时间周期逐渐发生,不断进行市场渗透。

这样的设备可能不止一种形态。从第一性原理出发,如果想让硬件去感知这个世界,肯定不能放在口袋里,需要是可穿戴设备,有好几种形态都符合要求,比如我们的AI相机、带摄像头的耳机,未来的AI眼镜也可能符合,还可能有其他形态会出现。

《智能涌现》:但创业做AI Native设备难度、挑战也更大,你们为什么这么选。

孙洋:我觉得跟我们的创业初衷密切相关。我跟博聪其实在美团的职位和收入都相对稳定。但选择创业并非仅仅为了做一个生意。我们俩都算是错过了国内移动互联网爆发的那一波浪潮,那时候我俩都在海外。这一波AI肯定是个新浪潮,我们不想再错过了。

我们都知道创业九死一生。但正是因为有九死,我们才更应尝试。今天至少我们在牌桌上跟这个行业一起玩,也许我们不成功,另一家公司把这个路跑通了,他成功了,那我也很高兴。至少大家在一个正确的大方向上,把一个新的、改变性的东西做出来了。这本身就是值得庆贺的尝试。

多模态AI硬件的想象力:从计算卡路里,到瑜伽老师

《智能涌现》:你们从AI的角度来打造生活相机,和大疆、Insta360算是竞品吗?

孙洋:我们的产品理念从根本上是不同的。他们的功能肯定还是以影像为主,追求画质、影像方面的提升,Looki其实更多想在内容和AI能力上做挖掘,所以也并不能替代传统相机。

作为一款AI Native硬件,在设计的时候,我们考虑的是让产品把这种AI感知能力发挥到最极致。所以Looki L1采用了索尼IMX681的图像传感器(和Meta Rayban同款),拍摄分辨率也只有1080p,这样可以保证12小时续航和30克的轻便,从而可以更好地感知和记录生活。

《智能涌现》:目前用户反馈,Looki L1用的最爽、最离不开的功能是什么?

孙洋:我们认为用户觉得最爽的是,终于有一个共鸣感知的东西能够交付给我。

例如我之前所提到的,如果Looki上的应用能提醒用户少摄入咖啡因,用户可能会感到有人在真正关心自己,从而产生愉悦感。

当用户在用餐时,Looki能识别食物并告知卡路里含量,这将是非常有帮助的信息。当用户在练瑜伽的时候,Looki也可以帮忙识别动作的准确度。

这样的应用就像是用户的第二或第三大脑,通过感知连接用户周边信息并与第二大脑相联,从而为用户提供有价值的insights。我认为这正是用户最需要的功能。

《智能涌现》:这个动作和结果,手机可以完成吗?

孙洋:这里面涉及到一个主被动关系的问题。你今天用手机其实也可以做到,但没有人会采取这种做法,因为在这种情况下,人依然是主动的,而AI则是被动的。我们期望能够改变这一状况,让AI变得主动,而人则保持被动。因为在物理世界中,人类本质上是被动的生物。

《智能涌现》:前面提到识别卡路里、瑜伽训练功能,感觉Looki这类硬件可以链接很多AI Agent或者服务商,AI功能会越来越丰富。

孙洋:会的,我们的产品发布后将推出一个developer program,这个计划允许用户推送各种agent,各个方向都会有,比如之前提到的training agent,即用于瑜伽训练的agent,它可能比我们自己官方的优化得更好。

《智能涌现》:Looki L1售价199美元,有什么对标产品吗?

孙洋:相似形态的Insta 360 Go 3算是一个吧,但其实我们并没有太多直接的对标物。价格定在200美元左右,这是美国消费者没有太大压力的价格区间。

《智能涌现》:在上手产品的前期,投喂给AI的数据量相对少一些,会不会导致体验不好。

孙洋:不会。Looki L1有多个功能,用户把一天的数据提供给AI,它已经能够非常好地理解这一天的story line,给用户自动剪辑一个Vlog,并挑选出一天中的亮点Moments,这个功能可以不受限于数据量。

当然也有一些功能依赖数据量,当积累越来越多的数据的时候,AI才会越来越了解用户。

《智能涌现》:大部分用户没有佩戴随身相机,或者吊坠的习惯,对于用户习惯问题,Looki如何应对?

孙洋:本质上产品的逻辑在于成本和收益,没有收益的时候用户当然不愿意戴任何东西。当然这需要一个明确的发展和演变时间,不会一蹴而就。

所以Looki在今天的早期用户也是垂类场景优先,包括陪伴孩子、宠物、旅游、户外运动爬山野营等等。只要AI给予用户好的体验,用户就可以一点点渗透、愿意去尝试新的场景。如果PMF确实找到了,那创新扩散和场景泛化是一个可以期待的事情。

《智能涌现》:你目前对这个产品的销量预期是多少?

孙洋:销量并不是衡量一个产品的核心指标。尤其是在AI硬件领域,市场仍处于初期阶段。我们的新产品发出去后,我们重点关注Looki产品的两个关键指标。首先是用户使用时长的表现。第二是看用户和它的交互方式会不会发生变化。

“创业公司没有壁垒,破局要靠非共识和足够快”

《智能涌现》:巨头的AI硬件进展都不算快,OpenAI的硬件产品也要等到2026年才发布,你的节奏是什么?

孙洋:做AI硬件需要较长的时间周期,从想到idea到真正落地,我们开发这款产品也已经一年了。而多模态模型在2024年的能力还不行,这就有一定的赌的成分。

直到今年年初Gemini2.0推出,多模态能力才上了一个台阶,现有这些场景的效果才做得好了一些。

我们决策做这件事更多的是靠一种conviction(信念),反正去年做不出来,那我们就赌一下。

有些公司可能更多的是从理性ROI的角度去评估。如果按照这个逻辑,等ROI成立了开始做,那今年年初或者四五月份,他们可能才刚下场,距离产品落地还有挺远的距离。

《智能涌现》:很多创新品类在初期都是不完善的,如果让你给Looki L1打个分,满分100分,你给打多少分?

孙洋: 我觉得用这个标准来衡量不是很合适。

因为所有产品的软件能力都是逐渐发展的。硬件本身只是个载体,软件方面,AI和数据结合后其实能做的事情非常之多,这个大模型技术能力以及生态的丰富程度都密切相关。可能100分的标准是逐渐在变化的,所以确实不好打分。

△图源:企业授权

《智能涌现》:你担心被模仿吗?怎么思考“产品壁垒”?

孙洋:没有壁垒。对于初创公司来说,所谓的壁垒都是扯淡。一个初创公司才成立一两年,资源有限,谈相对于大厂有什么壁垒,我觉得是自欺欺人。

但如果非要谈怎么能赢,我觉得首先要在一个非共识的赛道,这件事大部分人不认可,但最后证明可能也是对的,有认知差,这是第一个可能。

第二个是足够快,大家都还看不清楚,可能自己也并不清楚,就不断的去尝试,再收市场反馈,有可能试出来一个PMF,利用这个先机,把飞轮转动起来。我觉得就这两个可能,其他的壁垒都是自欺欺人。

《智能涌现》:有经历多轮周期的创业者跟我说,由于创投大环境不景气,这波AI硬件创业项目获得的资金支持远低于上一波。这对你们有影响吗?

孙洋:我认为这件事是相辅相成的,取决于你的预期是什么。

十几年前的创投环境宽松,一笔投资可以支持企业做多个产品。现在可能就是逐渐一点点迭代去融资,我觉得反而这种方式更健康。很多人会抱怨创业环境的困难,但我认为抱怨并无帮助。

其实无论是在大厂还是在初创公司,做事的逻辑都一样,关键在于如何让大家信任你。这需要你不断交付成果来证明自己。做好一件件事情,这种信任是一步步构建的。

《智能涌现》:那是不是意味着,当前环境对于失败的容错率变低了。

孙洋:我们内部有一句话:你可以优雅的失败。因为创业必不可能一帆风顺,在做各子项目的时候,很容易就会遇到一些挫折,本身创业就是一个不断试的过程,但是每一段尝试肯定都有底层逻辑,如果产品失败了,也可能积累了底层的技术上的infra,也可能积累了一个有战斗力的团队,等等等等。

绝大多数的创业公司其实都是在做第二款、第三款,甚至第四款产品的时候才会成功,我觉得其实每次失败不重要,更重要的是要积累东西。

《智能涌现》:后续的二代、三代产品会是什么方向?它们的迭代会是怎样的?

孙洋:一是肯定希望功耗越来越低,续航越来越长;另一个是在感知能力上、佩戴舒适度等方面也要提升。我们希望这个硬件能以更无感的方式带起来。当然今天的供应链能力还没达到。

AI能力上,希望能够更实时,和手机的这种连接、数据流能更顺。还有很多这种infra底层的东西需要去攻克。

阿里巴巴推出的 AI Agentic 编程工具

Qoder是阿里巴巴推出的 AI Agentic 编程工具,深度理解整个代码库架构,记忆并学习你的习惯,支持MCP工具生态扩展,提供上下文感知补全、内联聊天和一键「维基化」代码结构,自动选最佳模型。Qoder不是简单的代码补全工具,试图成为开发者真正的「思维伙伴」。预览阶段全功能免费开放,助力开发者专注解决真实软件难题。

Qoder

Qoder的主要功能

  • 智能代码库语义搜索:秒级跨文件、跨模块定位相关符号、调用链与依赖,Qoder支持自然语言与正则双模式查询并高亮影响面。
  • 深度架构洞察:自动构建依赖图、领域边界、设计模式与潜在技术债报告,定位问题根因并给出分层修复方案。
  • 持续记忆引擎:会话级与项目级双层记忆,记录开发者风格、团队规范、历史决策,越用越懂你并在后续互动自动应用。
  • 动态最佳模型路由:Qoder可以根据语言、任务类型、性能预算实时挑选最合适的 LLM,无需手动切换即可获得最优速度与精度。
  • 上下文感知补全:综合光标前后万级 token、目录结构、图片、日志、文档等多模态信息,生成行级补全与下一步编辑预测。
  • 内联聊天&重构:在代码旁直接对话,支持解释、生成单测、重构、性能剖析,无需切换窗口保持心流。
  • 一键“维基化”代码库:自动生成可交互的架构知识图谱、模块职责说明书、API 手册,支持全文搜索与版本对比。
  • MCP 工具生态:通过 Model Context Protocol 无缝接入数据库、API、浏览器、终端等外部工具,实现读写、调试、部署一条龙。
  • 多模态输入理解:Qoder支持截图、设计稿、日志文件、PDF、序列图等作为上下文,提升需求理解与缺陷复现准确度。
  • 零配置团队同步:记忆、规则、架构图实时云端同步,自动为新成员初始化环境,让团队代码风格与认知一致。

如何使用Qoder

  • 访问官网:使用电脑浏览器访问Qoder官网(https://qoder.com/),根据系统下载对应版本。
  • 安装使用:Qoder目前支持Windows和Mac电脑版(Intel芯片和Apple芯片均支持),下载安装包后安装,注册账号登录。
  • 首次启动会弹出浏览器登录页 → 用 GitHub / GitLab / Google 账户登录 → 勾选要授权的仓库 → 返回本地 IDE 即可。
  • 让 AI 理解整个项目:启动后点击 “Open Folder” 选项目 → 自动开始索引。
  • 使用 Quest Mode 委派任务
    • 侧边栏点击 Qoder 图标 → 选 “Quest” → 在输入框用自然语言描述任务,例如:

      Upgrade all usages of Axios to the latest version and open a PR

    • 点击 “Submit Quest” → 后台代理异步执行 → 完成后通知中心可查看 diff 与一键合并 PR。
  • 用 Memory 固化团队规范
    • 打开命令面板(Ctrl+Shift+P)→ “Qoder: Open Memory Rules” → 在打开的 JSON 里添加规则。
    • 保存后,所有补全和 Quest 都会自动遵循该规则;如需共享,点击右上角 “Share” 生成链接给团队成员一键导入。

Qoder

Qoder的核心优势与差异

传统编程工具只是帮你“写代码”,Qoder 则像一个“读过你全部代码、记得你全部习惯、能跨系统替你干活”的资深同事。

  • 全景式上下文:传统编程工具只看光标附近几十行,Qoder 在毫秒级把整个仓库、历史提交、图片、文档、外部 API 文档一次性读进上下文窗口,真正做到“代码即知识图谱”。
  • 会成长的记忆:传统工具设置每次重启归零,Qoder 的 Memory 把个人风格、团队规范、业务规则持续累积,换项目、换电脑也能秒同步。
  • Quest 异步代理:传统插件只能同步补全,Qoder 的 Quest Mode 把“升级依赖、批量重构、跑测试、提 PR”这种跨小时甚至跨天的任务托管到后台,完成后推送结果。
  • MCP 无限外挂:传统扩展靠插件市场缓慢更新,Qoder 通过开放 MCP 协议,可像浏览器装扩展一样即时接入数据库、Jira、Docker、云资源,能力随接随用。
  • 零决策模型路由:传统编程工具需要手动选 GPT-3.5/4,Qoder 根据语言、任务复杂度、成本预算自动选最合适模型,开发者无需关心“该用哪个 AI”。
  • 内联即全功能:传统重构要跳窗口、跑脚本,Qoder 在编辑器内直接对话即可完成解释、生成单测、性能剖析、一键应用补丁,全程不跳出 IDE。

Qoder的应用场景

  • 大规模代码迁移:一键发起 Quest,让 AI 在后台完成跨仓库依赖升级(如 Axios v0 → v1、Python 2→3、Spring Boot 2→3),同时生成兼容层、修复破坏性变更并提交 PR。
  • 架构腐化治理:利用全景依赖图与“维基化”报告,自动识别循环依赖、过时模块、重复实现;Quest 接着按分层规范重构,并持续记忆团队新订的架构原则。
  • 遗留系统逆向 & 文档补全:把无文档的百万行老项目扔给 Qoder,5 分钟生成可交互的架构知识图谱 + API 手册;后续任何新人提问“这块业务怎么跑”都可以直接在内联聊天里得到链路级回答。
  • 测试左移 & 覆盖率补齐:选中一个模块 → Inline Chat“为所有 public 方法生成单元测试并达到 80% 行覆盖” → Quest 自动写测试、跑 CI、把失败用例标成待修复 Issue。
  • 多语言微服务协同开发:在包含 Go、TypeScript、Python 的 mono-repo 里,Qoder 自动切最佳模型并用 MCP 调用各自的 linter / formatter / Docker build,保证跨服务接口一致、版本同步。
  • 需求 ↔ 代码 双向追溯:产品经理把 Figma 原型截图 + Jira 需求贴进 Quest,Qoder 通过视觉理解 + 需求文本自动生成对应前端组件、补全路由、填充假数据并绑定 API 草稿。
  • 安全与合规自动化审计:接入 OWASP MCP Server,Quest 会在每次 commit 后自动跑 SAST、许可证扫描,发现 CVE 立即提 PR 打补丁并更新 SBOM;Memory 把公司合规规则固化,防止复发。