科技资讯总览
今日科技领域多点开花:AI 模型与智能体持续进化,Anthropic 与 DeepSeek 分别带来重大发布;安全领域爆发大规模供应链攻击,同时 OpenAI 推出新一代网络防御模型;中国科研团队在超导、量子纠缠等前沿方向取得世界级突破,物理学界也在胶球证据上迈出关键一步。
🤖 AI 与机器学习
Hugging Face Transformers 稳居开发者必备工具榜首
Hugging Face 的 Transformers 库再度登上 GitHub 趋势榜,作为业界最主流的模型定义框架,它覆盖文本、视觉、音频与多模态模型的推理和训练全流程。无论学术研究还是工业部署,该库都已成为事实标准,其持续迭代有助于降低大模型开发门槛,推动 AI 应用生态进一步繁荣。
原文链接:https://github.com/huggingface/transformers
Anthropic 将 Claude Code 自动模式设为默认,AI 编程迈向更少监督
据 TechCrunch 报道,Anthropic 决定把 Claude Code 的 auto mode 转为默认设置,意味着开发者用 Claude 编写代码时,AI 可以更自主地完成多步骤任务,减少人工介入。这一变化将显著提升编码效率,但也促使团队重新思考 AI 生成代码的可控性与审计问题。编程助手正从“补全工具”演变为“自治协作者”。
原文链接:https://techcrunch.com/2026/08/09/anthropic-is-turning-claude-codes-auto-mode-on-by-default/
实战从零构建 Coding Agent:揭示智能体设计核心原理
掘金热榜文章《实战从零开始构建一个 Coding Agent:Violin》获得高热度。作者出于对日常使用 agent 原理的好奇,自己动手实现了一个编码智能体,并指出理解 coding agent 的构建原理,就掌握了理解其他智能体的一把钥匙。文章通过实际代码拆解了工具调用、任务分解、状态管理等关键环节,对希望深入 Agent 开发的工程师极具启发价值。
原文链接:https://juejin.cn/post/7670477819033796651
Meta 发布 Muse Glimmer:30B 参数专为本地 Agent 工作流打造
Meta AI 研究院推出了 Muse Glimmer,一个 30B 参数的开源多模态模型,专门针对“始终在线”的本地智能体场景优化。Hugging Face 提供了 day-0 支持,开发者们已开始用其构建演示,例如让模型调用工具对自己进行量化。30B 参数在端侧部署仍有硬件挑战,但这一方向体现了 AI 智能体向本地化、隐私友好演进的趋势。
原文链接:https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
研究版 Claude 攻克黎曼猜想关键下界:AI 数学推理的新里程碑
Anthropic 宣布,其未公开的研究版 Claude 在黎曼猜想研究中取得重大进展,将 ζ 函数临界线上零点比例的长期下界从 41.6% 提升到 67.2%。模型在 Claude Code 中自主完成实验,两次测试共生成 3100 万个输出 Token,经历 650 次失败,调集 60 个子级智能体,执行 2400 条 Shell 命令,并编写数百个 Python 脚本。结果虽已通过内部数学家验证并交外部专家审阅,但尚未见正式论文,AI 在纯数学证明中的能力令人充满期待。
原文链接:https://www.ithome.com/0/988/453.htm
DeepSeek V4 Pro 0813 低调亮相,引发社区热议
DeepSeek V4 Pro 0813 版本出现在 OpenRouter 平台,并在 Hacker News 上快速获得 667 分、234 条评论。官方尚未公布详细技术说明,但该版本的快速迭代已引发对其推理、编程能力的广泛讨论。作为开源模型阵营的重要力量,DeepSeek 的每次进步都直接冲击商业化闭源模型的性价比体系。
原文链接:https://openrouter.ai/deepseek/deepseek-v4-pro-0813
Meta 发布 Muse Glimmer:专为本地 Agent 工作流优化的开源模型
Meta 推出开源权重模型 Muse Glimmer,参数规模 30B,专为本地常驻 Agent 工作流设计,可在 Mac 或配备高性能 GPU 的 PC 上完整运行。该模型在关键 Agent 任务和基准测试中表现优于同规格模型,并沿用 Apache 2.0 许可。其价值在于降低了开发本地、隐私敏感型 Agent 应用的门槛,也是 Meta 开源 AI 路线的又一次加码。
DeepSeek V4 Pro 正式版发布,Agent 能力显著增强
8月13日晚间,DeepSeek V4 Pro正式版更新至API,调用模型名不变。新版不仅增强了Agent能力,还支持Responses API和Codex接入。根据官方群放出的评测对比,DeepSeek-V4-Pro-0813在多项测试中接近Fable 5水平,相比预览版能力大幅提升。定价方面,百万tokens输入缓存命中0.025元、未命中3元,输出6元,延续了极具竞争力的价格策略。对开发者而言,这意味着在构建复杂Agent应用时,又多了一个高性能、低成本的国产模型选择,尤其是对Codex生态的兼容,可能吸引更多开发者从闭源模型迁移。DeepSeek的快速迭代正在拉高开源/低价模型的性能基准,给商业模型厂商带来压力。
探秘 GPT/Claude 知识截止日期:模型“遗忘”的边界
一篇对 GPT 与 Claude 知识截止日期的深入分析在 Hacker News 引发关注,作者 sshh12 通过系统化测试,试图勾勒大模型训练数据的时间边界。了解知识截止日对于开发者至关重要——它直接影响模型在时效性问题上的可信度,也关乎检索增强生成(RAG)等外部知识补充方案的设计。该分析还触达了一个更深层的议题:模型预训练时间线如何影响其对近期事件的“无知”,以及这种局限是否可以通过微调或提示工程部分弥补。
iOS 27 Beta 5 惊现国行 Apple Intelligence 踪迹:本地化处理成定局
苹果正为国行 Apple Intelligence 积极准备。据 IT之家报道,开发者通过挖掘 iOS 27 Beta 5 更新代码,发现了一系列关于国行 AI 功能的字符串描述:为遵守中国法律法规,Apple Intelligence 将使用当地公司提供的安全机制,用户请求在设备上处理,不会发送给 Apple 或安全机制提供商;Apple 会以匿名化方式收集信息并以汇总形式共享。这意味着国行 AI 在隐私合规层面做了深度本地化适配,既满足监管要求,也延续了苹果“端侧优先”的隐私策略。此前业界期待的“苹果与本土 AI 厂商合作”传闻,今回的代码实证进一步收窄了想象空间。
Claude 数学能力大考:Anthropic 发布黎曼 ζ 函数评估
Anthropic 发布了一项针对 Claude 数学能力的研究,重点考察其在黎曼 ζ 函数等高等数学问题上的表现。该研究并非简单地测试“能解多少题”,而是深入分析 Claude 在不同数学分支中的推理模式——哪些问题凭借模式识别即可解决,哪些真正需要符号推理与证明能力。理解 LLM 的数学边界对于科研辅助、教育科技等应用场景意义重大,同时也有助于社区重新思考“AI 是否具备真正的推理能力”这一根本问题。
剑指 GPT-5.6 Sol,SpaceXAI 发布 Grok 4.6 模型
北京时间昨晚,SpaceXAI 正式发布 Grok 4.6。新模型在 Grok 4.5 基础上重点强化了长时间运行的智能体任务,能够持续处理资料研究、大型代码库分析、产品构想落地等多步骤复杂工作。基准测试方面,Grok 4.6 在综合 9 项测试的 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 打平,并在多项智能体编程和知识工作评测中达到前沿水平。目前该模型已登陆 Cursor 和 Grok Build,首周向用户提供双倍内含使用额度。训练层面,Grok 4.6 经历了比前代更长的补充训练,引入筛选后的模型生成推理数据与高质量工程数据,优化了后续监督微调与强化学习的基础。不过,官方基准与真实场景体验之间往往存在落差,实际表现仍有待开发者实测检验。
腾讯微信公布 WeLM 大模型:80B 版已上线小微,617B 版开发中
腾讯微信团队昨日在 X 平台披露自研大语言模型 WeLM,核心卖点是资源利用效率。目前已明确两个规格:WeLM-80B 总参数 800 亿、激活参数仅 30 亿;WeLM-617B 总参数 6170 亿、激活参数 230 亿,后者采用混合专家(MoE)架构,在保持适度激活参数的前提下提升通用理解与逻辑推理能力。其中 80B 版已部署于微信原生 AI 助手“小微”,支持聊天搜索、调用小程序服务等能力,是微信生态在端侧与云端协同的一次重要尝试。当前大模型赛道竞争焦点正从“参数规模竞赛”转向“稀疏激活效率之战”,WeLM 的落地路径值得关注。
AI 安全争议升温,辛顿、李飞飞、吴恩达同台呼吁保持开放
在拉斯维加斯举行的 Ai4 大会上,三位 AI 领域最具影响力的学者——杰弗里·辛顿、李飞飞和吴恩达罕见同台,围绕 AI 开放与监管展开讨论。三人一致担心 AI 技术发展速度被少数大型公司掌控,重演苹果和谷歌垄断移动操作系统的局面。辛顿特别区分了开源软件与开放权重模型:开源软件公开代码供任何人检查修改,而开放权重模型仅公开训练后的参数。他认为开放权重有助于竞争,但同时也承认这种方式存在被滥用的可能。李飞飞和吴恩达则从创新速度与中小企业发展角度出发,主张保留一定的开放空间。这一讨论的深层背景是,随着中国 AI 在亚洲快速推进,美国科技界正面临开放与安全之间的艰难平衡。
Google DeepMind 发布 SL2T:手语翻译达到 SOTA,支持单手握持场景
Google DeepMind 日前发布了手语翻译模型 SL2T,在学术基准上达到当前最优水平,并针对现实使用场景做了特别优化——例如单手打手语时另一只手正拿着手机。隐私设计是亮点:模型在设备端追踪身体姿态,服务器端仅接收姿态数据并翻译成文字,原始视频画面不会离开用户设备。手语翻译长期受限于数据稀缺和姿态捕捉精度,SL2T 将硬件传感器与语言模型结合的思路,为无障碍沟通提供了一条可落地的技术路径。
原文链接:https://x.com/GoogleDeepMind/status/2087541217965809850
AI 生成原生 PowerPoint:ppt-master 开源项目走红
一个名为 ppt-master 的开源项目近日登上 GitHub Trending。这个基于 Python 的工具能够将文档或主题直接转化为原生 PowerPoint 演示文稿,而非传统意义上的”模板套壳”。它支持原生形状、转场与动画效果,还能根据内容自动生成数据图表和表格,甚至可以将演讲者备注转换为音频旁白。更实用的是,它允许用户传入自己的 .pptx 模板,保证生成结果符合企业品牌规范。对于高频制作汇报材料的职场人群而言,这类工具正在把”排版耗时”从PPT制作流程中剥离,让内容组织成为唯一的创作焦点。
今日焦点:半导体产业链的扩张与重构(台积电封装扩产、韩系车用芯片国产化)与 AI 应用落地深化(PPT 自动生成、编程智能体进入 IDE)正在并行推进,前者塑造底层算力供给,后者决定技术价值的最终释放。