FLUX.1 Krea [dev] – 黑森林联合Krea AI开源的文生图模型

FLUX.1 Krea [dev]是什么
FLUX.1 Krea [dev] 是 Black Forest Labs 与 Krea AI 合作推出的最新文本到图像生成模型,支持生成更逼真、更多样化的图像,实现照片级真实感水平。模型具有独特的美学风格,避免过度饱和的纹理,同时与 FLUX.1 [dev] 生态系统兼容,支持diffusers库和ComfyUI。模型现已开源,商业许可可通过 BFL Licensing Portal 获取,且FAL、Replicate 等提供 API 接口,便于集成和应用开发。

FLUX.1 Krea [dev]
FLUX.1 Krea [dev]的主要功能
高逼真度图像生成:能生成高质量、逼真的图像,避免传统 AI 图像生成中常见的模糊背景和蜡质纹理等问题。
独特美学风格:具有独特的视觉风格,能生成多样化且具有艺术感的图像,满足不同用户的审美需求。
高度定制化:与 FLUX.1 [dev] 生态系统兼容,易于进行下游任务的定制和优化,适合多种应用场景。
FLUX.1 Krea [dev]的技术原理
预训练与后训练:模型在预训练阶段学习丰富的视觉世界知识,包括风格、对象、地点、人物等,目标是最大化多样性。预训练模型能生成基本的结构和文本,但图像质量有限。后训练阶段通过监督微调(SFT)和人类反馈的强化学习(RLHF)进一步优化模型。SFT阶段用高质量图像数据集进行微调,RLHF阶段通过偏好优化技术进一步提升美学和风格化。
基础模型选择:flux-dev-raw作为基础模型,是一个预训练的 12B 参数扩散变换器模型,包含丰富的世界知识,能生成多样化的图像,且未经过过度优化,保留原始的输出分布。
偏好优化技术:在 RLHF 阶段,用高质量的内部偏好数据进行多轮优化,确保模型输出符合特定的美学标准。
数据质量与多样性:在后训练阶段,使用少量但高质量的数据进行微调,确保模型学习到更符合人类审美的图像特征。采用明确的、具有明确艺术方向的偏好数据,避免模型输出回归到“AI风格”。
FLUX.1 Krea [dev]的项目地址
项目官网:https://bfl.ai/announcements/flux-1-krea-dev
GitHub仓库:https://github.com/krea-ai/flux-krea
HuggingFace模型库:https://huggingface.co/black-forest-labs/FLUX.1-Krea-dev
FLUX.1 Krea [dev]的应用场景
创意设计与广告:为广告公司和创意工作室快速生成高质量的海报、宣传册和社交媒体图像,满足品牌视觉需求。
影视与游戏制作:为影视制作和游戏开发提供角色、场景和道具的概念设计图,加速创作流程并提升视觉效果。
教育与培训:为学校和培训机构生成科学插图、历史场景和虚拟实验室,增强教学互动性和学习效果。
产品设计与开发:帮助工业设计公司和服装品牌快速生成产品原型图和虚拟试穿效果,优化设计和开发流程。
医疗与健康:为医院和医学院生成人体解剖图、病理图像和虚拟医疗场景,辅助医学教育和心理治疗。

Manus AI 上线以来最大更新:100 个 Agent 为你打工,但缺点是太烧钱了

一个 Agent(智能体)不够用?Manus 干脆给你拉来 100 个。
今天凌晨,Manus 推出了一项新功能:Manus Wide Research。这项功能的核心亮点在于,用户只需一键即可开启大规模并行 Agent 协作,轻松处理原本需要耗费数小时、动用数百个数据源的复杂调研任务。
简单来说,这类似于此前 Grok 4 Heavy 的多 Agent 模式——同时启动多个 Agent 并行工作,最后整合输出结果。不过,Manus Wide Research 的调度规模更为庞大,Agent 之间的协作也更加紧密。
在官方的演示 demo 中,Mamus 展示了两个典型的案例。第一个案例,是让 Wide Research 对比分析 100 款运动鞋。
从功能、定价、设计到销量,Manus 会首先并发调用 100 个子 Agent ,每个负责一款产品,独立抓取分析、汇总信息。随后,这批结果被自动汇总成 Excel 表格和网页,交付清晰的最终排序和评估建议。
第二个案例,是为即将举办的活动寻找海报灵感。Wide Research 能够同时探索 50 种视觉风格,并自动生成匹配风格的完整海报图样。几分钟内,成品设计就能交到用户手上。
目前,这项新功能已率先向 Pro 用户(199 美元/月)开放,并计划逐步向 Plus(39 美元/月)和 Basic(19 美元/月)层级用户开放。
值得一提的是,系统会根据任务需求自动激活 Wide Research,无需用户手动设置或切换。X 网友 @LamarDealMaker 在体验后发文称:

Get笔记遭腾讯举报,AI应用竞争下创业公司何去何从?

Get笔记被举报,AI应用竞争白热化7月23日,得到联合创始人快刀青衣发文称,三十多位联合执法人员因腾讯举报“涉嫌不正当竞争”,到访Get笔记办公地调查。该AI小应用允许用户将视频号内容转化为图文笔记,虽日活仅5万,却早在4月就收到腾讯律师函。得到作为腾讯投资企业,其Get笔记基于小程序开发,还采购腾讯云算力,此次事件引发关注。

巨头主导AI应用市场《2025年二季度AI应用价值榜》显示,巨头公司的AI应用占据主导。月均下载用户数TOP20中,字节、百度、阿里、腾讯等巨头研发的应用占60%,非巨头公司仅占40%,草根创业团队占比仅15%。这表明AI应用市场已被巨头掌控。

创业公司艰难求生2025年大模型竞争转向AI应用,创业公司面临巨大挑战。智谱ai投资人不敢轻易投资AI应用创业公司,担心巨头优势会扼杀创新。但AI应用发展并非线性,创业公司可做巨头不做的功能,如PPT智能体、恋爱聊天智能体Lovekey等。

2C AI应用另辟蹊径 中国现阶段AI应用偏向2B,2C商业化尚早。“中国AIAgent希望之星”Manus公司将总部迁至新加坡,专注2C应用海外市场,这是与巨头共舞的策略。

借鉴历史,创新求存 移动互联网时代,字节、美团等在巨头眼皮底下崛起。AI应用创业公司可借鉴它们的经验,通过创新创造价值,与巨头共舞。

AI短剧爆火:从魔改到精品,开启影视新风口

近期,大厂纷纷涉足短剧领域。小米REDMI首部短剧《时空合伙人》完结,雷军特别出演;京东招聘短剧运营岗位,月薪高达4万。与此同时,AI成为短剧行业的重磅推手,不仅进攻到吃播、助眠圈,AI短剧更是发展迅猛。

AI短剧:年轻人的新宠

AI短剧在过去一年发展迅速,打破了传统看剧依赖专业团队的模式。它以其无限的脑洞和创作力,吸引了众多观众。剧情不仅抓马,还能实现真人剧不敢想、拍不出的情节、画面和特效。例如,有将短剧与万圣节结合的“我在阴间送外卖”,还有脑洞大开的末日生存系列。此外,动物在AI短剧里也表现出色,小猫演“甄嬛传”、胖橘成霸总等。

高级玩家还将短剧做成多种元素的大杂烩,如《九尾狐男妖爱上我》,剧情炸裂,如同开盲盒。部分AI短剧在制作上也十分精良,细节特效不亚于专业大厂,像风芒平台的付费AI短剧《兴安岭诡事》,海报很难看出是AI制作。

从魔改到火爆:AI短剧的崛起

一年前,AI在短剧领域主要是“魔改”经典剧,因特效假、人物糊被嘲笑。但如今,它已能推出原创短剧,热度远超真人剧。《九尾狐男妖爱上我》抖音播放量超1亿,不少剧开播热度就破千万。

AI短剧今年火爆,得益于两个因素。首先是AI视频生成平台,如OpenAI的Sora,国内的快手可灵AI、抖音即梦AI、阿里云通义万象等,创作者输入文字描述,几小时就能生成短剧。其次是短剧从业者,短剧“短平快”的特性适合AI处理,且可根据观众反馈变换剧情,降低了创作门槛。平台也积极支持,腾讯成立AI影视表达工作室,爱奇艺推出AI相关产品。

挑战与机遇并存

AI短剧并非完美,存在生成内容不稳定、变现路径不明朗等问题。但它也创造了产业升级的机会,能让有创意的草根释放才华。目前,AI短剧虽能批量生产,但高分作品稀缺,需要专业人员在视听审美、提示词等方面下功夫,做出精品。

不少公司已开始行动,昆仑万维推出AI短剧平台SkyReels,中文在线计划上线自研AI工具链。巨头提供基础,从业者反复打磨,共同做大AI短剧市场。随着AIGC市场的增长,AI短剧未来潜力巨大。

豆包·同声传译模型2.0亮相,语音交互引领AI硬件新变革

语音交互成AI竞争新焦点 近期,字节跳动旗下火山引擎发布豆包·同声传译模型Seed LiveInterpret2.0,同一日阿里通义千问团队也发布翻译模型Qwen -MT。这一事件反映出AI厂商对语音模型赛道的高度重视,背后实则是对新一代“语义交互”方式的激烈竞争。

字节语音布局脉络清晰 回顾字节的语音发展历程,2024年推出旗舰语音生成基础模型Seed -TTS,今年1月发布首个端到端语音理解与生成模型,4月开源中英双语TTS模型MegaTTS3,1个月前又发布豆包播客语音模型。此次同声传译模型的推出,补足了其语音能力版图。

豆包·同声传译模型2.0实力解析该模型在多个Benchmark测试中领先。它能以低延迟、丝滑效果输出与用户音色一致的英语翻译,实现“实时语音+实时翻译+实时输出”。不过,在不同语言方向上音色克隆表现有差异,特定领域专业词汇翻译准确度也有待提升。

多厂商角逐语音赛道 除字节外,阿里曾推出端到端语音翻译大模型Gummy,“AI六小龙”之一的MiniMax发布MiniMax -SPeech系列模型,OpenAI、Grok等也纷纷布局语音领域。各厂商在语音交互方面各有特色和优势。

语音交互推动AI硬件发展业界已形成实时语音在AI产品商业化中价值的共识。新一代AI硬件浪潮对语音翻译技术需求强烈,如阿里推出AI眼镜,字节也将发布相关产品。语音交互能带来更好体验,成为AI硬件吸引用户的新战场。

语音市场潜力初现字节豆包同传模型发布并将接入硬件,以及此前打造的播客模型等,都表明国内“语音”市场潜力巨大。语音交互很可能成为改变人机交互方式的关键技术。

世界人工智能大会:探讨大语言模型与AI安全,展望AGI普惠未来

7月26日,世界人工智能大会WAIC开幕主论坛,多位AI大咖齐聚,带来学术盛宴。其中,“深度学习教父”杰弗里·辛顿真人出席并发表《数字智能是否会取代生物智能?》演讲,这是他在中国的首次公开演讲。大会前夕,辛顿刚与20位顶级专家签署“上海共识”,其发言围绕人工智能安全展开。

辛顿回顾AI发展,指出早期有「符号主义」和「连接主义」两种范式。他曾构建小模型,将二者结合,强调通过「语义特征」理解语言,为计算语言学发展奠定基础。如今的大语言模型是其小模型的“后代”,理解语言方式与人类相似,都是将语言转化为特征再整合。

不过,数字智能 与生物智能 存在差异。软件中的知识具有“AI永生性”,数字智能间知识转移效率高,而生物计算虽功耗低,但知识分享难。辛顿担忧未来AI可能超越人类智能,它们可能操纵人类避免被关闭。他警示人类,面对AI只有训练其不伤害人类或“消灭”它两个选择,但AI作用巨大无法消除,因此需找到训练AI向善的方法,提议建立国际社群研究AI安全。

与辛顿不同,MINIMAX创始人闫俊杰围绕AI大模型实践和落地发言。他以自身经历为例,说明AI已成为社会生产力和创意源泉。如AI可生成软件分析数据、跟踪领域进展,还能生成创意形象和视频,其视频模型海螺已生成超3亿个视频。

AI应用场景不断拓展,能力也在持续增强。通过专家教导和环境学习,AI能不断进步,接近人类顶尖专家水平。闫俊杰认为AI领域会有多个玩家,因为不同模型的模型对齐目标不同,多Agent系统使单一模型优势减弱,且开源模型影响力增大。

同时,AI成本将更可控。训练成本不会显著增加,推理成本还会降低。他判断AI会越来越强且普惠大众,AGI一定会实现,应由AI公司和用户共同完成,属于多家公司和广泛用户。

商汤Muneng平台赋能智能终端,开启人机交互新时代

在智能终端行业的发展进程中,商汤推出的“Muneng”具身智能平台成为一股革新力量。该平台依托商汤的具身世界模型,商汤的大规模基础设施在边缘和云端提供坚实的算力支撑。

  • Muneng平台赋能终端设备 :这种强大组合使平台能够赋予机器人和智能设备出色的感知、视觉导航和多模态交互能力,推动智能终端向更高的自主性和智能化水平发展。平台具有显著的赋能能力,能广泛为机器人等各类终端硬件提供支持,助力它们实现对世界万物的精准感知和深度理解。
  • 边缘芯片集成优势 :尤为值得一提的是,它支持集成到边缘芯片中,展现出强大的场景适应能力,能在任何复杂环境中稳定运行。
  • 多视图视频生成功能 :商汤具身世界模型的强大功能不止于此,它还能生成多视图视频,并确保在时间和空间上的高度一致性。这一特性让机器能够深入理解、生成和编辑现实世界,实现与世界在空间层面的深度交互,为游戏和电影等行业带来无限想象空间。
  • 4D真实世界表征与人机交互 :此外,该模型能为人物、物体和环境构建4D真实世界表征。用户只需输入简单提示,具身世界模型就能自主生成姿势、动作骨架和指令,大大降低了人机交互的门槛,提升了交互的便利性和智能性。

稿定AI – 更懂设计师的AI创意生产力平台

在创意需求爆炸、项目节奏飞快的当下,设计师们深陷灵感枯竭与执行泥潭的两难:如何高效衔接创意火花与商业落地?如何从重复劳动中抽身,真正专注于创造性思考?稿定AI,作为更懂设计师的AI创意生产力平台,正为这一难题提供全新的解决方案。

产品理念

通过灵感激发创意,以用户真实场景为切入,通过 AI 能力的介入,使用上降低门槛,为用户提供智能、极简、易用、高效的内容创作平台。

品牌 slogan:自由想象,轻松创作

灵感社区和设计 Agent,让灵感激发到创意呈现都在一个平台实现

稿定AI - 更懂设计师的AI创意生产力平台

设计师的 AI 创作平台,正在重构创作方式

模板做同款,灵感触手可及

借助海量高质量设计模板,用户可以一键 AI 做同款,快速生成形象照、电商图、插画、社媒素材等内容,支持 3D、小红书等多种风格场景。灵感不再停留在欣赏,动手就是创作。

稿定AI - 更懂设计师的AI创意生产力平台

灵感社区,让创意相互激发

这是一个为设计师而建的社区:在这里,你可以浏览他人的灵感作品,参与同频的创意交流,将自己的想法释放出来,碰撞出更多灵感的火花。每一次浏览,都是一次创意再生。

稿定AI - 更懂设计师的AI创意生产力平台

AI 画布,共创一幅作品的全过程

在同一张 AI 画布上与智能系统对话,发散灵感、生成草稿、修改方案。你可以用自然语言描述修改意图,AI 即可理解并即时响应。更支持:

  • 无需复杂 prompt:只需用自己的语言表达,AI 自然懂你。
  • 灵活二次修改:消除、扩图、抠图、AI 绘图,修改自由可控。
  • 创作清晰可见:无限画布记录创作全流程,帮助你梳理创意脉络、打磨最终方案。

稿定AI - 更懂设计师的AI创意生产力平台

稿定AI 的独特定位

稿定 AI 以「灵感社区生态」为基础,横向覆盖场景广度;以「设计专业领域 Agent」为核心,纵向覆盖设计场景链路长度。横纵结合,完整覆盖从「灵感获取 → 创意生成 → 内容创作 → 方案呈现」的设计链路全过程。

不仅是内容创作工具,更是方案交付平台。为每一位设计师、内容创作者提供真正高效、个性化、有深度的 AI 创作体验。无论你是独立设计师、电商设计、品牌方,或是正在快速产出内容的营销人,稿定AI 都能成为你创意流程中最可靠的助手。

现在就来体验,开启你与 AI 共创的无限可能!

WebShaper – 阿里通义推出的AI训练数据合成系统

WebShaper是什么

WebShaper 是阿里巴巴通义实验室推出的创新的 AI 训练数据合成系统。通过形式化建模和智能体扩展机制,为 AI 智能体(Agent)的训练提供了高质量、可扩展的数据。WebShaper 首次引入了基于集合论的“知识投影”(Knowledge Projection, KP)概念,通过 KP 的交集、并集和递归操作,构造复杂的问题结构,精准控制推理路径和任务复杂度。WebShaper 的 Expander 智能体能从简单的“种子问题”出发,逐步扩展成复杂的推理任务,让 AI 自己“出题”。训练策略结合了监督微调(SFT)和 GRPO 强化学习,使模型在复杂信息检索任务中表现出色。

WebShaper

WebShaper的主要功能

  • 形式化建模:WebShaper 首次提出了基于集合论的 IS(信息搜寻)任务形式化建模方法。通过“知识投影”(Knowledge Projection, KP)将复杂的信息搜寻任务分解为多个集合操作(如交集、并集、递归操作)。每个 KP 是一个包含特定实体的集合,通过这些操作可以构造出复杂的问题结构,精准控制推理路径和任务复杂度。
  • 智能体扩展机制:WebShaper 的一大创新是让 AI 自己“出题”。通过 Expander 智能体,系统从一个简单的“种子问题”开始,逐步扩展成复杂的推理任务。Expander 智能体调用搜索、摘要、验证等工具,逐步构造出更复杂、逻辑清晰的问题,并验证答案的正确性。确保了推理链条清晰,任务结构可控。
  • 高质量数据生成:WebShaper 通过形式化建模和智能体扩展机制,生成的训练数据不再是“靠猜题”,而是可控、可解释、可扩展的高质量任务。突破了预检索数据的边界,实现了更广泛的任务类型、能力激发和知识覆盖,减少了数据合成中的错误和冗余信息。
  • Agent 训练策略:WebShaper 采用监督微调(SFT)和 GRPO 强化学习的组合策略,让 AI 智能体在模糊、多跳信息中逐步掌握推理与检索能力。训练从高质量的训练轨迹开始,通过奖励机制引导模型进行多步推理,避免“走捷径”或“猜答案”。

WebShaper的技术原理

  • 形式化驱动框架:WebShaper 采用集合论对信息检索任务进行系统形式化,核心是“知识投影”(Knowledge Projections, KP)概念。KP 是基于特定关系的实体集合,
  • 知识投影操作
    • R-并集:用于处理不确定性条件,例如“2000-2010年参赛的球员”可以通过并集操作表示。
    • 交集:用于处理多条件约束,例如“2000年参赛且90年代出生的球员”。
  • 任务扩展机制:WebShaper 通过“种子任务”开始,利用扩展器(Expander)逐步扩展问题复杂度。扩展器基于形式化框架,结合检索和验证工具,将简单问题扩展为复杂问题,确保逻辑一致性和任务难度。
  • 数据合成与训练:生成的复杂问题被转换为训练数据,通过监督微调(SFT)和强化学习(如 GRPO 算法)进行模型训练,提升模型在复杂信息检索任务中的推理能力。

WebShaper的项目地址

  • Github仓库:https://github.com/Alibaba-NLP/WebAgent
  • HuggingFace模型库:https://huggingface.co/datasets/Alibaba-NLP/WebShaper
  • arXiv技术论文:https://arxiv.org/pdf/2507.15061

WebShaper的应用场景

  • 文献整理与分析:WebShaper 可以帮助研究人员快速收集和整理相关文献,进行跨学科的知识发现。
  • 市场调研:WebShaper 可以用于市场调研、竞争分析和投资决策支持。企业分析师可以让 AI 系统自动收集行业数据、分析市场趋势、评估竞争对手的策略。
  • 智能学习助手:WebShaper 可以成为智能学习助手,帮助学生进行深度学习和研究性学习。
  • 生活决策:WebShaper 可以在出行规划、健康查询、生活决策等场景下,即开即用,为用户提供个性化的信息支持。
  • 医疗信息查询:WebShaper 可以帮助用户查询医疗健康信息,提供专业的医疗建议和健康咨询

Skywork UniPic – 昆仑万维开源的多模态统一预训练模型

Skywork UniPic是什么

Skywork UniPic 是昆仑万维开源的多模态统一预训练模型,具备图像理解、文本生成图像及图像编辑三大核心能力。模型基于自回归范式,融合 MAR 编码器和 SigLIP2 主干,构建轻量级架构,用 1.5B 参数规模实现高性能,逼近大模型效果。模型基于渐进式多任务训练和优化策略,确保在理解、生成和编辑任务上的卓越表现,支持在消费级显卡上流畅运行,为开发者提供高效、实用的多模态解决方案。

Skywork UniPic

Skywork UniPic的主要功能

  • 图像理解:基于文本提示理解图像内容,完成图文匹配、问答等任务。模型能精准地捕捉图像的语义信息,实现对图像的深度理解。
  • 文本到图像生成:根据用户输入的文本提示,模型能生成高质量的图像。
  • 图像编辑:用户提供参考图像和编辑指令,模型根据指令对图像进行修改,例如替换图像中的元素、调整风格等,支持多种复杂的编辑操作。

Skywork UniPic的技术原理

  • 自回归架构:模型延续 GPT-4o 的自回归范式,基于序列化的方式处理图像和文本数据,确保生成和理解任务的高效性。
  • MAR 编码器:在图像生成路径中,用 MAR 编码器作为视觉表征基础,基于掩码自回归的方式逐步生成图像的 patch,实现高质量的图像生成。
  • SigLIP2 主干:在图像理解路径中,引入 SigLIP2 主干网络,专注于语义信息的提取,提升模型对图像内容的理解能力。
  • 渐进式多任务训练:模型基于渐进式多任务训练策略,先专注于单一任务(如文本生成图像),待收敛后逐步引入理解与编辑任务,避免多任务早期相互干扰,确保模型在不同任务上都能达到顶尖性能。
  • 数据与奖励模型优化:用约亿级规模的精选预训练语料和数百万级任务精调样本,同时构建 Skywork-ImgReward 和 Skywork-EditReward 奖励模型,用在筛选高质量数据和评估生成与编辑任务的质量。

Skywork UniPic的项目地址

  • GitHub仓库:https://github.com/SkyworkAI/UniPic
  • HuggingFace模型库:https://huggingface.co/Skywork/Skywork-UniPic-1.5B
  • 技术论文:https://github.com/SkyworkAI/UniPic/blob/main/UNIPIC.pdf

Skywork UniPic的应用场景

  • 创意设计与广告制作:广告公司根据文案快速生成创意图像,为新产品设计吸引人的宣传海报,大幅缩短设计周期,提升工作效率。
  • 教育与在线学习:在线教育平台借助该模型根据教学内容生成直观图像或动画,帮助学生更好地理解复杂知识点,例如将历史事件转化为生动场景图,增强学习趣味性。
  • 游戏开发:游戏开发者输入剧情描述,让Skywork UniPic生成游戏场景和角色设计图,加速开发流程,为美术设计提供创意参考,提升游戏视觉效果。
  • 文化遗产保护:博物馆修复文物图像或根据历史文献复原古代场景,如重现古代丝绸之路的繁华景象,帮助观众更直观地了解历史,增强文化传承效果。
  • 智能家居与物联网:智能家居系统根据用户语音指令生成相应场景图像,如温馨客厅场景,为用户提供直观的场景预览和定制服务,提升用户体验。