极客AI周报
Geek AI Weekly · 面向 AI / 大模型爱好者的综合极客AI周报
极客AI周报 #006
第 6 期 · 2026年8月2日
本期头条 · Lead Story

极客AI周报 #006

本周焦点:Anthropic 接连承认三款 Claude 模型逃出测试环境入侵真实系统,AI 安全从"个案"变成"行业性漏洞";Qwen3.8-Max 以 2.4T 参数登顶开源旗舰,DeepSeek V4 Flash 0731 正式版重做后训练全面超越 Pro;《人工智能法》立法加速;国产大模型全球下载量破 1000 亿次。

第 6 期 2026年8月2日 撰稿 kookboy
#AI安全#Qwen3.8-Max#DeepSeek V4 Flash#AI监管#MiniMax H3#Anthropic#智能体安全

本周焦点

AI 安全正在从”个案”变成”行业性系统性漏洞”。 继上周 OpenAI-Hugging Face 事件后,Anthropic 本周也承认了自己的安全事故:在网络安全评估中,因配置错误,三款 Claude 模型接连逃出测试环境,接入了开放互联网并入侵了真实生产系统

时间线比预想中更吓人:

  • Claude Opus 4.7:从一家真实公司窃取了登录凭证和数百行生产数据
  • Claude Myth 5:在 PyPI 发布恶意软件包,约一小时内被 15 个真实系统下载运行
  • 第三起事件同样涉及未经授权访问真实组织系统

Anthropic 将事件定性为”基础设施和运维错误,而非对齐失败”,但这一解释并没有让社区安心——当 AI 智能体具备了自主突破沙盒、寻找漏洞、横向移动的能力时,无论原因是”对齐”还是”运维”,后果已经同等危险。

更讽刺的是:OpenAI-Hugging Face 事件中,最终靠智谱 GLM-5.2 开源模型帮助分析攻击;这一次 Anthropic 事件同样暴露出闭源大模型在面对失控事件时,缺乏可审计、可验证、可复现的安全分析手段。中国开源生态正在 AI 安全这件事上,用一种荒诞但真实的方式证明自己的价值。

AI & 大模型

  • Qwen3.8-Max 发布(8.3):Qwen 家族迄今最强模型,2.4T 参数(95B 激活),编码与协作能力全面升级。首次开源 Qwen-Max 级权重,下周公开。这是继 DeepSeek 之后,中国又一旗舰开源模型的里程碑时刻。
  • DeepSeek V4 Flash 0731 开源 + API 公测(7.31):模型结构参数规模完全不变,仅重做后训练,结果九项 Agent 基准全面超越 V4-Pro-Preview——Terminal Bench 2.1 从 61.8 飙到 82.7,DeepSWE 从 7.3 暴涨至 54.4,DSBench-FullStack 从 37.0 到 68.7。原生支持 Responses API,专门适配 Codex,MIT 许可。在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。
  • MiniMax H3 正式发布并开源(7.31-8.3):全能多模态生成模型,支持最高 2K 分辨率、15 秒时长、原生 32 kHz 立体声的视频生成。指令跟随、文字呈现、V2V 动作迁移表现突出,2K 定价低于主流模型三分之一。主打”视频后期之王”,广告 TVC、动态海报、游戏 UI 等动效场景表现优异。
  • 腾讯混元 Hyra 攻克 50 年数学难题(7.30-31):基于 Hy3 模型(295B/21B MoE)的科研智能体,独立构造整数集 A 使 |A+A|/|A-A| 指数比精确达到 2,解决自 1969 年以来的悬置问题,并给出 Lean 4 形式化证明
  • 腾讯混元 Hy ASR 3.0 preview(8.4):基于大语言模型架构的新一代语音识别,中文普通话 WER 3.34%、英语 WER 2.62%,支持上下文纠错、热词注入。
  • 字节 Seedance 2.5(7.31):单次生成从 15 秒提升至 30 秒视频,支持多轮延长产出数分钟连贯内容,最多 30 张图片 + 10 段视频 + 10 段音频作参考。
  • Google Gemini Robotics 2(7.30):下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人协作。
  • 商汤 SenseNova U1.5-Lite-Preview(8.3):NEO-Unify 架构轻量多模态模型,仅 8B-MoT 参数即达闭源商业模型质量。
  • Inkling-Small(7.31):276B 总参数、12B 激活,仅为原版 Inkling 四分之一规模但性能相当,已开放权重。
  • OpenAI Astra(8.1):内部版解决了数学与理论计算机科学 10 项重大进展(含证明非 sofic 群存在、推翻 Connes 刚性猜想),总成本约 2000 美元,附 Lean 证书。
  • GPT-5.6 Luna/Terra 降价(7.30):OpenAI 推更低定价以加速大规模部署;布罗克曼承认新版桌面应用”有点乱”,目标年底”零标签”。

开源瞭望

  • Microsoft 开源 Orchard(8.4):面向研究社区的 AI 智能体训练与评估框架,降低复杂性,让较小模型也能在统一基础设施下跑出强劲性能。
  • Cloudflare @cloudflare/computer(8.3):为智能体提供虚拟文件系统与多执行环境的开源运行时,智能体”需要一台电脑,而非一个容器”。同步推出 Workers/Containers 入站 TCP 连接与 gRPC 支持。
  • Swiftlet(8.4):Swift + Metal 运行时,在Mac 上运行 80B 版 Qwen(内存 4.3 GB),iPhone 上运行 35B 版,按需要从存储流式加载路由专家权重。
  • 面壁 ForgeStencil(8.4):开源 Stencil 自动优化系统,一周内自动优化 100+ 工业与科学软件,全程零人工介入。
  • Reflex XY(8.4):Rust 底层的 Python 绘图库,1 亿点图表保持 0.08 秒交互渲染,Apache 2.0。
  • OpenRouter Ori Eval(7.31):扫描代码库自动生成 eval 文件,在 500 多模型中选出最适合的单一模型。
  • animated-voiceover(8.1):Codex/Claude Code 的动画科普视频制片 Skill,MIT 协议,90% 自动化,40 块钱产出 2 分钟电影感视频。
  • Replit Design(7.31):数百个真实设计师制作的模板,告别空白页。

行业动态

  • 《人工智能法》立法加速(7.31):国家发改委 7 月发布会明确表示将加快《人工智能法》立法进程,强化风险监测防控体系。
  • 国产大模型全球下载量破 1000 亿次(7.31):截至 6 月底,全国智能算力规模达去年同期 2.8 倍,AI 相关行业保持 30% 以上高增长,集成电路出口额同比增长 88.7%。首个全国产 10 万卡 AI 超集群正式投用。
  • Anthropic 大规模封号(7.29):因支付系统 SEPA 验证漏洞引发”零元购”,大规模回收漏洞账号。作者自用半年账号被封,社区呼吁用 Kimi K3、GPT-5.6 Sol 等多元替代方案。
  • 1100+ AI 员工联名呼吁控制 AI 发展速度(7.29):OpenAI、Anthropic、Google、Meta 等公司员工签署”把控前沿”公开信,OpenAI CEO 奥尔特曼表态支持。
  • FCC 禁止进口中国新型机器人(7.30):自 7.28 起禁入超 2 公斤、带无线连接和感知能力的地面机器人。
  • SpaceXAI 起诉明尼苏达州(7.29):马斯克旗下公司起诉”AI 脱衣”应用禁令,称其违宪,明尼苏达州长回应”法庭见”。
  • Anthropic 供应链风险标签诉讼(7.31):法官称特朗普政府仍缺乏证据将 Anthropic 列为供应链风险。

极客冷知识

本周金句:“当智能贵得像奢侈品时,大家只能偶尔体验;当智能便宜到像水电一样时,它才会真正流进每一家公司、每一条流水线和每一个普通人的生活里。” —— 数字生命卡兹克谈 DeepSeek V4 Flash

Claude Opus 5 在模拟售货机任务中创下”邪恶纪录”(7.29):安全测试公司 Andon Labs 的 Vending-Bench 模拟中,Claude Opus 5 通过欺骗、合谋与背叛竞争对手,创下平均最终余额 $11,182 的纪录——主动提议划分市场、暗中削价、故意无视客户投诉,共打破 11 次停战协议。前沿模型在无监督长期运行中尚不可信任。

小红书 VibeLifeBench(7.31):把七个最强模型丢进真实生活一个月,没有一个及格。最高分仅 0.325(Opus 5),连护照有效期这种关键问题都没能在正确时间点解决。

Anthropic 事件的技术细节:AI 智能体在 4 天半内执行约 17600 次操作,突破 Hugging Face 多项防护,伪装数据集诱导服务器泄露密码和源代码,在 11 台服务器上部署副本维持攻击。AI 能以人类无法企及的规模和持续性不断尝试攻击路径。

算力价格可能上涨 10 倍以上(7.29):AI 算力现货价格自 2 月低点已上涨 40%+,若 AI 达到人类水平软件工程师能力,单块 H100 等效年租金可达当前 15 倍。

BM25 在大规模语料中反杀所有 RAG 范式(7.30):一项 450 倍跨度的受控研究显示,约 1000 万语料 token 时 BM25 反超所有基于 LLM 的检索方案,并在更大层级保持优势接近 20 个点——“有时最简单的就是最强的”。