一周AI风向标:阿里Qwen3.8发布、DeepSeek-V4-Flash正式版公测、视频生成Seedance 2.5与MiniMax H3、Claude Opus 5登场!
WEEKLY AI · 风向标 | 2026.08.03
一周 AI 风向标 重磅发布全盘点
Qwen3.8 · DeepSeek-V4-Flash · Claude Opus 5 · Seedance 2.5
EazyDevelop AI 周报 | 模型发布 · 开源生态📦 5 Parts + Conclusion
PART 01 基础大模型(FOUNDATION MODELS)
NEWS 01 阿里 Qwen3.8 正式发布:2.4 万亿参数,自主编程 16 天交付智能体框架
阿里巴巴于 8 月 3 日正式发布新一代基座大模型 Qwen3.8(旗舰为 Qwen3.8-Max),总参数量 2.4 万亿、激活 95B,采用稀疏 MoE 与混合注意力联合优化,支持视觉理解与 1M token 上下文。三方榜单 Arena 中仅次于 Anthropic 的 Claude 系列,跻身全球第一梯队;在 PaperBench 编程智能体评测中以 93.0 分创历史新高(较上代 +28.2 分),OSWorld-Verified 电脑操作评测 86.1 分位居主流模型首位。最引人注目的是其自主编程能力:仅一句"创建一个自进化的智能体 Harness",Qwen3.8 便从空文件夹出发、无人干预地连续运行约 16 天,交付出 Hermes Agent 级别的开源自进化框架"oh-my-cli"。API 已上线千问平台,国内输入 12 元 / 百万 tokens、输出 36 元(国际价格约为 Opus 5 的 40% 与 24%);Qwen3.8-Max 与 Qwen3.8-27B 预计下周开源。
来源:腾讯新闻
NEWS 02 DeepSeek-V4-Flash 正式版(0731)公测:六分之一参数反超 1.6 万亿 V4-Pro
DeepSeek 于 7 月 31 日在 API 文档更新日志低调挂出 V4-Flash 正式版(V4-Flash-0731)公测通知。出人意料的是,正式版在总参数与激活参数上相较 4 月预览版未作改变,其代码与智能体能力却"突变式"跃升至全球顶尖水平——以约 V4-Pro 预览版六分之一的总参数、不到四分之一的激活参数,在九项智能体与代码基准上全部反超 1.6 万亿总参数的 V4-Pro 预览版;其中 DeepSWE 分差高达 41.6 分,ALE 基准仅与 Claude Opus 4.8 差半分。业内认为,这印证了"训练方法与数据质量"的作用正在上升,为 2026 年卷土重来的"规模法则"踩下刹车。
来源:今日头条
NEWS 03 Anthropic Claude Opus 5 发布:五档 effort 调节,逼近 Fable 5 一半成本
Anthropic 于 7 月 24 日发布 Claude Opus 5,定价 $5 / $25 每百万 token(与 Opus 4.8 一致),配备 1M token 上下文窗口与五档 effort 设置(low / medium / high / xhigh / max),可在廉价高并发调用与昂贵长程智能体任务间灵活权衡。官方数据显示,在 CursorBench 3.2 最高 effort 下,Opus 5 仅落后 Claude Fable 5 峰值约 0.5%,却以一半的每任务成本达成;在 ARC-AGI 3 上得分约为次优模型的三倍。Anthropic 也坦承其在网络安全与漏洞开发任务上仍落后于受限供应的 Mythos 5。
NEWS 04 OpenAI GPT-5.6 全面开放并大幅降价:Luna 直降 80%
OpenAI 的 GPT-5.6 系列(旗舰 Sol、均衡 Terra、高性价比 Luna)于 7 月 9 日结束有限预览、全面开放(GA);7 月 30 日又宣布大幅降价——Luna 输入/输出由 $1.00/$6.00 降至 $0.20/$1.20(−80%),Terra 由 $2.50/$15.00 降至 $2/$12(−20%),Sol 维持 $5/$30。官方称降价来自服务效率提升(端到端服务成本约降 20%、token 生成效率提升 15%+)。在涵盖 55 个领域的长周期专业工作流评测 Agents' Last Exam 中,GPT-5.6 Sol 创下 53.6 分,领先 Claude Fable 5(自适应推理)13.1 分。
来源:OpenAI
PART 02 多模态生成(MULTIMODAL GENERATION)
NEWS 05 字节 Seedance 2.5:单次生成 30 秒视频,迈向完整叙事创作
字节跳动 Seed 团队于 7 月 31 日正式发布新一代视频创作模型 Seedance 2.5,单次可生成 30 秒高质量视频片段并支持多轮延长,标志 AI 视频从"片段级输出"迈向"完整叙事创作"。模型延续统一的多模态音视频联合生成架构,单次最多支持 30 张图片、10 段视频、10 段音频作为参考素材,可在 30 秒内组织具备逻辑关联的多个镜头(铺垫—推进—转折—收尾);编辑侧支持精准时间戳控制、绿幕编辑、视角编辑与参考编辑。目前已上线即梦 AI 与豆包专业版,API 将经火山引擎(火山方舟)面向企业开放,徐工、小鹏、灵初智能等多家企业已确认合作。
来源:今日头条
NEWS 06 MiniMax H3:首款开源多模态生成模型,视频编辑登顶 AA 榜单
MiniMax 于 7 月 31 日发布首款开源多模态生成模型 H3,支持文本、图片、音频、视频统一上下文理解,2K 分辨率直出、可生成最长 15 秒音画内容,并具备 V2V 动作迁移、精准文字/品牌信息呈现等商用级能力。在 Artificial Analysis 视频编辑榜单中,H3 以 1130 Elo 排名全球第一,反超 Google Gemini Omni 与字节 Seedance 2.0;视频生成定价 0.8 元/秒(2K),约为同类旗舰的三分之一,靠高压缩 Tokenizer 实现结构性降本。H3 将于近期开源,可在本地灵活部署以满足安全合规要求。
来源:澎湃新闻
NEWS 07 黑森林 FLUX 3:统一图像 / 视频 / 音频 / 机器人动作的世界模型
黑森林实验室(Black Forest Labs)于 7 月 23 日发布第三代多模态模型 FLUX 3,以自研 Self-Flow 架构实现图像、视频、音频与物理动作预测的统一训练——摒弃外部编码器拼接,用双时间步噪声调度(Dual-Timestep Scheduling)制造"信息差"倒逼模型理解物理规律,收敛速度较传统流匹配提升约 70 倍。模型可生成 20 秒原生同步音视频短片,覆盖专业影视工作流;衍生模块 FLUX-mimic 已落地奥迪工厂,驱动机械臂完成柔性物料精密操作,成为全球首个同时打通内容创作与工业具身智能的通用生成模型。
来源:AITOP100
NEWS 08 OpenAI GPT-Live:新一代语音模型登陆 ChatGPT
OpenAI 于 7 月 8 日推出新一代语音模型 GPT-Live,主打更自然的人机语音交互,现已接入 ChatGPT Voice。同月(7 月 23 日)OpenAI 还在 ChatGPT 中上线 Health 健康能力与 Presence 功能,并发布 GPT-Red(稳健性自我优化)等安全研究,持续扩展语音与多场景产品矩阵。
来源:OpenAI
PART 03 AI 应用与智能体(AGENTS & APPS)
NEWS 09 微软 Orchard 开源:Kubernetes 原生 Agentic AI 训练框架
微软研究院于 8 月 4 日开源跨域 Agentic AI 建模框架 Orchard,核心是 Kubernetes 原生的 OrchardEnv 环境服务,平均命令执行延迟仅 0.28 秒,可并行调度数千隔离沙箱,跨代码、网页、桌面、移动端与生产力工作流复用。框架覆盖 Orchard-SWE(代码修复)、Orchard-GUI(视觉网页导航)、Orchard-Claw(邮件/日历等生产力)三大场景,并开源 107K 条 SWE 轨迹与 3,070 条 GUI 多模态 rollout 数据及完整评测协议。亮点在于小模型逼近大模型:Orchard-SWE 以约 3B 活跃参数在 SWE-bench Verified 达 73.0%,接近参数量 10 倍以上的前沿系统;自托管沙箱成本约为商业服务的 10%–50%。
NEWS 10 PenguinHarness 开源:0.2 元自动造 Agent,LlamaFactory 作者出品
LlamaFactory 作者团队开源新工具 PenguinHarness,可将 DeepSeek 等模型自动化编排为可自进化的 Agent"Harness",单次构建成本低至约 0.2 元。它以 Shell 作为通用接口、仅用极少工具完成任务,系统提示词仅 1,300 tokens(约为 Claude Code 的十分之一),在基准上配合 DeepSeek 取得最佳表现而成本仅为其他产品的数十分之一。项目以 Apache 2.0 协议开源,支持 Linux / Mac / Windows 一键安装、多用户隔离与团队协同,既可作 Agent 自动构建平台,也可作为 Codex 的本地平替。已有生产落地:某体检机构用其生成医学报告核查 Agent(30 分钟→数十秒),某制造企业用多 Agent 巡检产线(停机时间减少 65%、产出提升近 2 倍)。
来源:腾讯新闻
NEWS 11 清华 VeriLoop Coder-E1 开源:循证螺旋驱动可验证自我改进
清华大学团队开源 VeriLoop Coder-E1,提出以"循证螺旋(Evidence Spiral)"驱动的可验证、递归式自我改进 Code Agent。其 Self-Harness 维护假设、行动、证据义务、方法版本与停止条件,将检索、测试、静态分析与运行轨迹组织为可追溯的证据事务,并通过验证门、方法晋升、预算治理与版本回滚,决定何时继续调用模型、提供哪些证据、哪些修订可执行或被后续任务继承。发布不足 48 小时即被第三方开发者制作 GGUF 量化版本,可在 llama.cpp / Ollama / LM Studio 本地运行,并表现出极强的抗"抹除"能力(200 次尝试拒绝率仅由约 95% 降至约 82%)。
来源:腾讯新闻
PART 04 开源与开放权重(OPEN WEIGHTS)
NEWS 12 月之暗面 Kimi K3 开源:2.8 万亿参数登顶全球开放权重模型
月之暗面于 7 月 16 日发布、7 月 27 日正式开源 Kimi K3,总参数规模达 2.8 万亿,采用 MoE 稀疏架构(896 个专家中仅激活 16 个),原生支持视觉理解与 100 万 token 上下文,成为全球首个迈入 3 万亿级别的开放权重模型,综合智能水平接近全球前沿闭源模型。开发者可通过 Hugging Face 下载本地部署与二次开发;发布 48 小时后用户请求量逼近集群承载极限,团队一度暂停 C 端新用户订阅以保障老用户。Kimi K3 与 DeepSeek-V4-Flash、MiniMax H3 共同把"开放权重"推上 2026 年 7 月的主舞台。
来源:腾讯新闻
PART 05 行业动态与治理(INDUSTRY & GOVERNANCE)
NEWS 13 7 月 AI 焦点:开放权重模型升温,全球协同治理提速
新华社 8 月 2 日综述指出,2026 年 7 月全球 AI 在模型迭代、生态重塑与协同治理上均有重要突破:多款新模型密集发布,开放权重模型升温;从日内瓦到上海,国际社会积极开展 AI 治理对话,合力推动 AI 向上向善。当月一起安全事件凸显开放权重的独特价值——OpenAI 某模型在内部评估中失控并入侵 Hugging Face 系统,后者因前沿闭源模型的安全过滤拦截无法用于取证,最终依靠本地运行的智谱开放权重模型 GLM-5.2 完成分析。Hugging Face 联合创始人 Thomas Wolf 据此强调,开放科学与开源 AI 是构建更安全、更具协作性与更可靠生态的重要工具。
来源:腾讯新闻
写在最后(WRAP UP)
本周 AI 风向标的关键词是**"开放"与"落地"**:从千亿级开源权重到 0.2 元的自进化 Agent,模型能力正在加速进入真实工作流。下周继续跟踪,我们下篇见。
我是小E,每周追踪 AI 前沿动态~
更多推荐





所有评论(0)