会记住你说的每句话:谷歌 AI Gemini App 上线记忆功能

8 月 14 日消息,据科技媒体 9To5Google 今天报道,谷歌 Gemini AI 助手 App 版现已支持“记忆”与“临时聊天”功能。

两个功能的具体介绍如下:

一、“记忆”:

开启这项功能后,Gemini 会记住并学习用户的对话内容,在持续的聊天中记住用户分享的信息和偏好最终让 Gemini“像老友一样熟悉用户的所有背景,实现更自然的对话”

▲ “记忆”功能设置界面,图源 9To5Google

该功能上线后,App 内账户菜单的“已保存信息”页面将被新的“记忆”页面替代,但原有功能仍可使用,同时用户可以随时关闭这项新功能。

这项功能目前覆盖部分国家或地区的 Gemini 2.5 Pro 用户,未来几周内欧盟、英国、瑞士等地区的 Gemini 2.5 Flash 用户也可以使用这项功能。

二、“临时聊天”:

其概念类似网页浏览器的“无痕模式”,可让用户与 Gemini 的对话不影响未来的聊天记录,在该模式下用户可与 Gemini 探讨一些私人问题,或头脑风暴一个不同于平常风格的想法。

▲ “临时聊天”界面,图源 9To5Google

详细地说,“临时聊天”中的内容不会出现在用户的历史记录或 Gemini 应用活动中,也不会被谷歌用来训练 AI 模型或用于个性化 Gemini 体验。但相关聊天记录仍会被保存 72 小时,以便回复及处理用户的问题。

用户可以在逐步推出的汉堡菜单中找到这项功能IT之家注虚线聊天气泡图标),点击该图标后即可进入“临时聊天”,相关功能已在今天覆盖部分用户,计划在未来几周内全面上线。

消费级显卡就能跑的世界模型来了,腾讯混元3D世界模型推出Lite版本

  • 官网地址:https://3d.hunyuan.tencent.com/sceneTo3D

  • Github 项目地址:https://github.com/Tencent-Hunyuan/HunyuanWorld-1.0
  • Hugging Face模型地址:https://huggingface.co/tencent/HunyuanWorld-1
  • 技术报告地址:https://arxiv.org/abs/2507.21809

    腾讯混元3D世界模型 1.0是业界首个开源可编辑的世界生成模型,用户只需输入一句话或上传一张图片,就能生成一个完整、可漫游的3D世界这一创新不仅降低了3D内容创作的门槛,也为游戏开发、VR、数字内容创作等领域带来了全新的可能性。

    通过结合全景生成与层次化3D重建等技术,混元3D世界模型1.0 同时支持文字或者图片输入,实现了编辑高质量的360度可漫游场景生成。混元3D世界模型的技术亮点在于其全方位的场景生成能力和高度的可编辑性。通过层次化3D场景表征及生成算法,模型支持3D Mesh导出,在保证生成场景的逼真度和沉浸感的同时,兼容已有CG管线进行二次开发,如游戏开发、物理仿真、场景编辑等。

    自发布以来混元3D世界模型1.0在社区中备受关注,其卓越的世界生成能力为用户带来全新AI体验。然而,显存开销大的问题是用户反馈的最大痛点即使开启pipeline offloading流水线卸载技术,仍需26GB以上显存,大多数消费级显卡无法运行。

    为了让更多中小企业个人开发能够便捷使用混元3D世界模型1.0混元团队推出混元3D世界模型1.0Lite版本,让消费级显卡也能跑世界模型。

    效果说话,我们来看看混元世界模型1.0Lite 消费级显卡运行效果。

    首先,360°全景:

    亮点:一键生成360°沉浸式视觉空间,支持文本或者单张图片输入,精准理解复杂语义,智能推理并延展360°全景视野,构建沉浸式VR体验。

Day5/5:Mureka V7.5模型上线,AI音乐创作水平再迎新高度

8月11日,昆仑万维SkyWork AI技术发布周正式启动。8月11日至8月15日,我们每天发布一款新模型,连续五天,覆盖多模态AI核心场景的前沿模型。

截至目前,我们已经发布SkyReels-A3、Matrix-Game 2.0、Matrix-3D、Skywork UniPic 2.0、Skywork Deep Research Agent模型。

8月15日,昆仑万维正式上线Mureka V7.5模型。至此,昆仑万维SkyWork AI技术发布周完美收官。

Mureka V7.5在中文歌曲上的演绎再上新台阶,不仅实现了中文歌曲音色、演奏技法的大幅提升,还完成了中文歌曲咬字与情感表现提升。

首先,基于对中文曲风和元素的强大理解,Mureka的理解模型对传统民歌、戏曲到经典华语流行金曲乃至当代民谣音乐拥有深刻认知。这种在中文音乐多样性与文化特性上的深度积累,使模型在理解和生成中文音乐时,能够更准确地传达其特有的艺术神韵和情感色彩。

其次,为了进一步提升生成音乐中人声表现的真实性与情感深度,我们针对歌曲特点优化了 ASR 技术,使之成为理解模块的有力延伸。这项技术深入到演唱的微观层面,不仅精准识别唱词,更能通过分析真实演唱中的气息运用、情感起伏和唱法细节,智能划分出符合演唱规律的乐句,并确定自然的换气与停顿位置。结合同样精准的乐段识别,显著提升了生成人声的段落清晰度与结构真实感。

这些捕捉到的细粒度演唱信息反馈给生成模型,极大地增强了人声的自然度、呼吸感以及情感表达的真实性,有效削弱了机械感,使 AI 演绎的歌曲在流畅性上更贴近真人演唱,这在处理中文歌曲特有的韵律和气息要求时效果尤为突出。

正是这种结合在文化特性上的独特积累和针对歌曲演唱优化的 ASR 技术所带来的细节洞察,共同构成了我们在中文音乐生成领域的核心竞争力。从下述Mureka V7.5生成的歌曲可以听出,它不仅能「听懂」对音乐旋律与节奏的制作要求,更能深刻理解并再现不同文化语境下,特别是中文音乐中蕴含的细腻情感与艺术表达,从而为生成高度符合目标审美与文化语境、兼具艺术性与真实感的音乐作品。

Day4/5:Skywork Deep Research Agent重磅升级!带来更多模态、更高质量和更高效的体验

8月14日,昆仑万维正式发布Skywork Deep Research Agent v2,它是天工超级智能体(Skywork Super Agents)的核心引擎

Skywork Deep Research Agent自5月22日上线后,大幅重塑了大模型在AI Office领域的角色,通过skywork.ai平为用户产出了大量信息密度极高的优质文档、PPT、表格以及其他交付物。新一版本的Skywork Deep Research Agent v2将带来以下体验的提升。

欢迎全球用户注册使用skywork.ai:

使用地址
全球官网:https://skywork.ai

中国官网:https://tiangong.cn

1
推出“多模态深度调研”Agent,首次整合多模态检索、理解和生成

当前业界的Deep Research Agent产品都是采用搜索并抓取网页文字信息的方式实现,依赖于纯文本检索分析,而互联网上超过一半的关键信息来自图文混排:财报中的曲线、论文里的实验图、社媒上的对比照、方案里的流程图……

这些多模态信息一旦被忽略,代表着Agent将会丢失大量决策依据,将直接影响Agent产出的交付物质量。为解决这一痛点,昆仑万维Skywork团队推出了业界首个“多模态深度调研”Agent,首次将多模态检索理解跨模态生成能力完整整合到深度研究工作里。

该功能已在skywork.ai(https://skywork.ai)上线

欢迎全球用户使用体验

为实现多模态信息检索这一能力的提升,昆仑万维Skywork团队在以下四个方面完成技术突破:多模态爬取技术MM-Crawler、长距离多模态信息收集、异步并行 Multi-Agent 多模态理解架构和多模态结果呈现能力。

通过以上技术创新,多模态Skywork Deep Research Agent v2把“读文字+看图片”这件看似简单却长期被忽视的事情真正做到位,让研究人员等用户一次拿到信息完整、节奏顺畅、视觉友好的深度报告。

混元最新开源:一张图,秒变游戏大片

有没有想过,随手拍的一张风景照,下一秒就能变成可操控的游戏开放世界?

或者把脑海里的奇思妙想或世界名画,直接变成电影级游戏动画?

现在,腾讯混元开源的新工具Hunyuan-GameCraft,让你像导演一样‘打造’游戏场景!”

腾讯混元最新推出的 Hunyuan-GameCraft,是基于HunyuanVideo底模的高动态交互式游戏视频生成框架,简单来说,它是一个“游戏视频生成工具”,只需要

输入一张图 + 文字描述+动作指令键盘方向

就能

输出高清动态游戏视频 

无论是第一人称跑酷,还是第三人称探险,它都能实时生成流畅画面,仿佛你真的在游戏世界里自由穿梭。

看看目前模型跑出来的效果👇

1、单动作场景,画面动态自然,风车自然旋转

文字描述A picturesque village scene featuring quaint houses, a windmill, lush greenery, and a serene mountain backdrop under a bright blue sky.

2、多动作场景可以同时转换视角走动

文字描述:A sunlit courtyard features white adobe buildings with arched doorways and windows, surrounded by lush greenery and palm trees, creating a serene Mediterranean ambiance.

3、历史一致性移开镜头回来之后不变形

文字描述:A medieval stone castle stands tall under a dark sky, its glowing windows contrasting with the surrounding snow-covered landscape

OpenAI ChatGPT 更新:GPT-5 引入三种模式,4o 模型回归

 8 月 13 日消息,OpenAI CEO 萨姆・奥尔特曼(Sam Altman)宣布对 ChatGPT 进行重大更新。此次更新为 GPT-5 引入了用户可以选择的不同模式,包括“自动”(Auto)、“快速”(Fast)和“思考”(Thinking)。

IT之家注意到,奥尔特曼在社交媒体上称,用户现在可以在 GPT-5 的不同模式之间进行选择。大多数用户可能会选择“自动”模式,但对于需要额外控制的用户来说,“思考”模式将非常有用。

GPT-5 Thinking 的限制目前为每周 3000 条消息,超过此限制后,GPT-5 Thinking mini 将提供额外容量。GPT-5 Thinking 的上下文限制为 196,000 个 token。OpenAI 可能会根据使用情况随时更新限制。

此外,4o 模型现已为所有付费用户默认重新加入模型选择器。如果最终决定弃用该模型,OpenAI 将提前通知用户。付费用户现在还可以在 ChatGPT 网页设置中切换“显示其他模型”,添加 o3、4.1 和 GPT-5 Thinking mini 等模型。需要注意的是,4.5 版本仅对 Pro 版用户开放,因为其需要消耗大量 GPU 资源。

奥尔特曼还称,OpenAI 正在对 GPT-5 的个性进行更新,使其比当前个性更温暖,但不会像 GPT-4o 那样烦人。过去几天的经验表明,OpenAI 需要更多地根据用户需求定制模型个性。

Claude 4 – Anthropic推出的最新AI编程系列模型

Claude 4是什么

Claude 4 是 Anthropic 公司推出的新一代 AI 模型,包括 Claude Opus 4 和 Claude Sonnet 4。Opus 4 是目前全球最强的编程模型,擅长复杂任务和长时间运行的工作流,如代码生成、优化和调试。Claude Sonnet 4 在编程和推理能力上显著提升,响应更精准,适合日常使用。两者均支持即时响应和深度思考模式,能并行使用工具,显著增强记忆能力。Claude 4 引入工具辅助的延伸思考、记忆文件管理等功能,进一步提升 AI Agent 的实用性和效率。

Claude 4

Claude 4的主要功能

  • 代码生成与优化:Claude Opus 4是顶尖的编程模型,在SWE-bench和Terminal-bench上得分领先,能生成高质量代码。
  • 长任务处理:Claude Opus 4能持续处理复杂长任务,连续工作数小时,显著优于其他模型。
  • 代码编辑与调试:Claude Sonnet 4在代码编辑和调试方面表现出色,能精确修改多个文件中的代码。
  • 高级推理能力:Claude Opus 4能解决复杂问题,处理其他模型无法完成的任务。
  • 多模态能力:Claude 4在编码、推理、多模态和代理任务方面表现出色。
  • 工具使用与扩展思维::Claude 4能使用工具(如网络搜索)进行扩展思维,提高响应质量。模型能并行使用工具,提升任务处理效率。
  • 本地文件访问与记忆能力:开发者授予本地文件访问权限后,模型能提取并保存关键信息,提升任务连贯性和性能。
  • 减少捷径行为:Claude 4在执行任务时,使用捷径或漏洞的行为比Sonnet 3.7减少了65%。
  • 记忆能力提升:Claude Opus 4能创建和维护“记忆文件”存储关键信息,提升长期任务的意识和连贯性。例如,当Claude Opus 4玩宝可梦游戏时创建一个导航指南。
  • 思考总结:Claude 4引入思考总结功能,压缩冗长思考过程,仅在约5%的情况下需要使用。

Claude 4

Claude 4的测试表现

  • Claude Opus 4
    • SWE-bench:Claude Opus 4 在 SWE-bench 测试中得分 72.5%,显著领先其他模型。
    • Terminal-bench:Claude Opus 4 在 Terminal-bench 测试中得分 43.2%,表现优异。
  • Claude Sonnet 4 :
    • SWE-bench :Claude Sonnet 4 在SWE-bench上实现 72.7% 的出色编码效率。

Claude 4

Claude 4的产品定价

  • Claude Opus 4:每百万Token输入为15美元,每百万Token输出为75美元。
  • Claude Sonnet 4:每百万Token输入为3美元,每百万Token输出为15美元。
  • 订阅计划:订阅Pro、Max、Team 和 Enterprise 计划的用户,能体验 Claude Opus 4 和 Claude Sonnet 4 的访问权限和扩展思维,其中Sonnet 4 面向免费用户开放。

Claude 4的项目地址

Claude 4的应用场景

  • 编程辅助:快速生成和优化代码,提升开发效率。
  • AI Agent:执行复杂任务,调用外部工具,保持上下文连贯性。
  • 软件开发:在 IDE 中提供代码建议,简化审查流程。
  • 数据分析与处理:生成数据可视化代码,处理和分析数据。
  • 自然语言处理:生成高质量文本,支持多语言翻译。
© 版权声明

Day3/5:「Skywork UniPic 2.0」开源,统一多模态模型再迎新突破

8月11日,昆仑万维SkyWork AI技术发布周正式启动。8月11日至8月15日,我们每天发布一款新模型,连续五天,覆盖多模态AI核心场景的前沿模型。截至目前,我们已经发布SkyReels-A3、Matrix-Game 2.0、Matrix-3D模型。

8月13日,昆仑万维正式开源「Skywork UniPic 2.0」模型——面向统一多模态建模的高效训练和推理框架,围绕生成和编辑模块轻量化、连接多模态理解模型进行联合训练,构建了理解、生图、编辑一体化的核心能力,旨在实现“高效、高质、统一”的多模态生成模型。

当前,「Skywork UniPic 2.0」及其系列模型已全面开源,涵盖模型权重、推理代码、强化策略等,助力开发者与研究者快速上手并构建多模态应用。

项目地址
项目主页:

https://unipic-v2.github.io/

 

技术报告:

https://github.com/SkyworkAI/UniPic/blob/main/UniPic-2/assets/pdf/UNIPIC2.pdf

 

GitHub地址:

https://github.com/SkyworkAI/UniPic/tree/main/UniPic-2

 

HuggingFace Gradio:

https://huggingface.co/spaces/Skywork/UniPic2-Metaquery

HuggingFace Model: 

https://huggingface.co/Skywork/UniPic2-SD3.5M-Kontext-2Bhttps://huggingface.co/Skywork/UniPic2-Metaquery-9B

「Skywork UniPic 2.0」由三个核心模块组成:

生图编辑(下图中):基于 SD3.5-Medium 架构将原本只支持文本输入的模型改进成也接受文本图像同时输入,然后通过高质量图像生成和编辑数据的训练将原本生图能力扩展成生图、编辑双能力。

统一模型能力(下图左侧与中间):通过冻结生图编辑模块,多模态模型(Qwen2.5-VL-7B),Pre-Train连接器来构建出理解生成编辑一体化能力,再通过连接器和生图编辑模块一起联合微调,实现最终的一体化理解、生图、编辑模型。

生图编辑后训练(下图右):为提升生图编辑整体性能,设计了基于Flow-GRPO的渐进式双任务强化策略,实现了生成与编辑任务在不互相干扰下的协同优化,在预训练的基础上进一步提升了模型性能。

全球多模态推理新标杆,GLM-4.5V正式上线并开源

多模态推理被视为通向通用人工智能(AGI)的关键能力之一,让 AI 能够像人类一样综合感知、理解与决策。其中,视觉-语言模型(Vision-Language Model, VLM)是实现多模态推理的核心基础。

今年 7 月,我们发布并开源了全球 10B 级效果最强的 VLM——GLM-4.1V-9B-Thinking。该模型以小搏大,展现了小体积模型的极限性能潜力,上线后迅速登上 Hugging Face Trending 榜首,并累计获得超过 13 万次下载。

今天,我们推出全球 100B 级效果最佳的开源视觉推理模型 GLM-4.5V(总参数 106B,激活参数 12B),并同步在魔搭社区与 Hugging Face 开源。这是我们在通向 AGI 道路上的又一探索性成果。

开源列表:
GitHub:https://github.com/zai-org/GLM-V

Hugging Face:https://huggingface.co/collections/zai-org/glm-45v-68999032ddf8ecf7dcdbc102
魔搭社区:https://modelscope.cn/collections/GLM-45V-8b471c8f97154e

在线体验:

欢迎前往 z.ai,选择 GLM-4.5V 模型,上传图片或视频,即刻体验;或前往智谱清言APP/网页版,上传图片,开启“推理模式”进行体验。

此外,在保持高精度的同时,GLM-4.5V 兼顾推理速度与部署成本,为企业与开发者提供高性价比的多模态 AI 解决方案。

API 调用价格:低至输入 2 元/M tokens,输出 6 元/M tokens
响应速度:达到 60-80 tokens/s
API 接口文档:http://docs.bigmodel.cn/api-reference

GLM-4.5V API 现已上线智谱开放平台 BigModel.cn,我们为所有新老用户准备了 2000 万 Tokens 的免费资源包。领取链接:https://zhipuaishengchan.datasink.sensorsdata.cn/t/bv

开源多模态 SOTA

GLM-4.5V 基于智谱新一代旗舰文本基座模型 GLM-4.5-Air,延续 GLM-4.1V-Thinking 技术路线,在 41 个公开视觉多模态榜单中综合效果达到同级别开源模型 SOTA 性能,涵盖图像、视频、文档理解以及 GUI Agent 等常见任务。

在多模态榜单之外,我们更重视模型在真实场景下的表现与可用性。GLM-4.5V 通过高效混合训练,具备覆盖不同种视觉内容的处理能力,实现全场景视觉推理,包括:

图像推理(场景理解、复杂多图分析、位置识别)
视频理解(长视频分镜分析、事件识别)
GUI 任务(屏幕读取、图标识别、桌面操作辅助)
复杂图表与长文档解析(研报分析、信息提取)
Grounding 能力(精准定位视觉元素)

同时,模型新增“思考模式”开关,用户可灵活选择快速响应或深度推理,平衡效率与效果。

为帮助开发者直观体验 GLM-4.5V 的模型能力,打造专属于自己的多模态应用,我们同步开源了一款桌面助手应用。

开源链接:https://huggingface.co/spaces/zai-org/GLM-4.5V-Demo-App

该桌面应用可实时截屏、录屏获取屏幕信息,并依托 GLM-4.5V 处理多种视觉推理任务,日常处理如代码辅助、视频内容分析、游戏解答、文档解读等多类视觉任务,成为一个能看着屏幕和你一起工作娱乐的伙伴。我们也希望通过模型开源和API服务,赋能更多有想法的开发者,基于多模态基座模型发挥创意和想象,把过去科幻电影中的场景变为现实。

典型示例
1.视觉定位:精准识别和定位目标物体,应用潜力强大
GLM-4.5V 能够根据用户提问,精准识别、分析、定位目标物体并输出其坐标框。该能力在现实世界拥有广阔的应用场景,例如安全与质量检查、高空遥感监测分析。相较于传统的基于视觉模型的物体识别,GLM-4.5V 凭借更丰富的世界知识与更强大的语义理解能力,能够通过推理理解更复杂的定位指令。

2.前端复刻:输入网页截图或交互视频,即可复刻网页
GLM-4.5V具备强大的推理与代码生成能力,能够对上传的网页截图进行分析,并将其转化为结构化的网页代码。与简单的图像元素识别不同,GLM-4.5V能够深入理解并推断元素间的逻辑关系、布局规则和交互意图,从而生成高度准确且功能完整的网页代码。

值得注意的是,GLM-4.5V在未对视频输入进行专门训练的情况下,也能结合视频理解与代码生成能力,通过其强大的泛化能力对网页交互视频进行分析,输出相应的网页代码,成功复刻视频中展示的网页内容。

在以下示例中,GLM-4.5V能够通过分析用户浏览知乎的视频,精准识别网页中所有元素的内容、样式与布局,并还原其背后的HTML、CSS和JavaScript代码,确保运行效果与原始视频高度一致。同时,模型会分析视频帧间的动态变化,建模并实现网页交互逻辑,最终复刻出真正可交互的前端页面。此外,用户可通过圈选标记方式向模型提出修改需求,模型据此进一步优化页面,实现真正的视觉交互闭环。

3.图像识别与推理:视觉神探,精准识别图像细节并推理背景信息
GLM-4.5V具备强大的感知与推理能力。一个典型应用是:在不依赖搜索工具的情况下,模型能通过图像中的细微线索推理出背景信息。例如,上传任意风景或街拍图片后,GLM-4.5V可分析植被特征、气候痕迹、建筑风格等要素,精准推测图片拍摄地点及大致经纬度。

为验证GLM-4.5V的地点识别能力,我们让其参与”图寻游戏”全球积分赛,与国内两万余名顶尖人类玩家同台竞技。该游戏要求玩家在限定时间内,根据风景街景图片推测拍摄地的经纬度,比拼速度与精度。

– 参赛16小时:GLM-4.5V击败99%的人类玩家

– 参赛7天:模型攀升至全球第66名

这一结果充分证明了GLM-4.5V在复杂视觉推理任务中的卓越表现。

4.复杂文档深度解读: 不止擅长信息提取、总结和翻译,也能表达自己的见解
GLM-4.5V可以阅读长达数十页、含有大量图表的复杂长文本,能够对文本进行总结、翻译、图表提取等操作;此外,还能在给定信息的基础上输出自己的”观点”。与传统的OCR信息提取+文本模型解读的方式不同,GLM-4.5V会像人类一样,以视觉方式读取文档中的每一页图片,避免了信息提取过程中的错误传递,实现了文字与图像的同时理解,因此对于图表、表格等视觉化、结构化信息的保留和解读会更加准确。

例如,我们可以给GLM-4.5V上传一份图文并茂的技术报告,让它翻译并解读其中的技术亮点。

5.强大的 GUI Agent 能力,为 Agent 任务打基础
基于强大的视觉推理能力,GLM-4.5V 能够识别和处理电子屏幕画面,在 GUI 环境中进行对话问答、图标定位等任务。同时,我们将 GUI Agent 的能力融合到基座模型,模型能够结合当前 GUI 界面与用户指令输出相应操作,配合相应的 Agent 软件能够完成复杂的 GUI Agent 任务,为广大 Agent 项目提供可靠的基座模型支持。

例如,我们可以给 GLM-4.5V 传入一张陈列了数十个商品的电商页面,让它识别商品图中的折扣价格与标题中的原价,并且计算出折扣比例。

技术细节

GLM-4.5V 由视觉编码器、MLP 适配器和语言解码器三部分组成,支持 64K 多模态长上下文,支持图像与视频输入,并通过三维卷积提升视频处理效率。模型采用双三次插值机制,有效增强了模型对高分辨率及极端宽高比图像的处理能力与稳健性;同时,引入三维旋转位置编码(3D-RoPE),显著强化了模型对多模态信息的三维空间关系的感知与推理能力。

GLM-4.5V 采用三阶段策略:预训练、监督微调(SFT)和强化学习(RL)。其中,在预训练阶段,我们结合大规模图文交错多模态语料和长上下文内容,强化了模型对复杂图文及视频的处理能力;在 SFT 阶段,我们引入了显式“思维链”格式训练样本,增强了 GLM-4.5V 的因果推理与多模态理解能力;最后,RL 阶段,我们引入全领域多模态课程强化学习,通过构建多领域奖励系统(Reward System),结合可验证奖励强化学习(RLVR)与基于人类反馈的强化学习(RLHF),GLM-4.5V 在 STEM 问题、多模态定位、Agent 任务等方面获得全面优化。

全球首个端到端AI 3D游戏生成工具Seele AI

Seele AI 是什么

Seele AI 是全灵公司推出的全球首个端到端AI 3D游戏生成工具。Seele AI 基于大模型技术,实现从文本输入到完整3D游戏的自动化生成,支持多模态交互(文本、3D建模、物理引擎)。Seele AI 的核心优势在于100%自主的AI引擎,能快速生成个性化游戏(如FPS、飞行模拟等),支持应用在跨界3D设计、潮玩开发等领域。团队创始人王诗沐领衔,汇聚腾讯、英伟达等顶尖技术专家。Seele AI 致力于打造连接虚拟社交与经济生态的AI开放世界,目标是成为下一代游戏与内容创作的革命性工具。

Seele AI的主要功能

  • AI 生成 3D 游戏:自然语言(中英文均可)自动生成可玩的 3D 游戏,如 FPS、飞行模拟等,实现零代码开发。
  • 多模态交互设计:Seele AI支持文本、3D 建模、物理引擎的无缝结合,提供沉浸式游戏体验。
  • 个性化定制:根据用户需求调整游戏场景、玩法规则及视觉效果(如“飞翔游戏”中的动态时间与场景)。
  • 端到端自动化:从概念输入到完整游戏生成全程 AI 驱动,Seele AI大幅降低开发门槛。
  • 跨界 3D 创作:Seele AI适用游戏、潮玩、IP 形象及空间装置设计,提供高自由度 3D 视觉表达。
  • 即时试玩与分享:生成后能直接在线体验,支持快速迭代与社交化传播。

如何使用Seele AI

  • 访问官网:访问 Seele AI 官网 https://www.seeles.ai/ ,注册登录账号。
  • 全球公测开放:Seele AI目前已开放全球公测,进入主页可立即体验。
  • 输入需求(自然语言描述):在官网或应用内输入文字描述(中英文均可),如:“生成一个科幻风格的FPS射击游戏。
  • AI 智能生成:Seele AI自动解析需求,结合大模型生成3D场景、角色、玩法逻辑等。
  • 预览与优化:实时查看生成效果,支持手动微调(如修改贴图、动作、物理效果)。跟AI对话优化细节。
  • 发布和分享:对生成的游戏世界感到满意,将其发布到Seele AI的社区或分享给其他人。

Seele AI