AI 模型 2026/09/30 02:15 X:Arena (@arena)
Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。
展开正文 Claude Sonnet 5.5 (High) 由 @AnthropicAI 推出的真实世界结果出炉了。它刚刚以 1699 分在 Code Arena: WebDev 中排名第 #4,并凭借其成本效率重塑了帕累托前沿! Claude Sonnet 5.5 (High) 以每百万 token 综合 $8 的价格提供了近乎顶尖的性能,重塑了帕累托前沿!该模型比总排名第 #3 的 Claude Fable 5.1 (Max) 和排名第 #2 的 GPT-6 Astra (Max) 都便宜 80%。 见下方帕累托位置。 总体而言,Claude Sonnet 5.5 (High) 相比排名第 #37、得分 1540 的 Sonnet 5 (High) 提升了 +159 分。与其前代变体相比的这一提升目前也体现在以下关键领域: - 基于参考的设计:#38 → #4 - 模拟:#37 → #4 - 游戏:#36 → #4 祝贺 @AnthropicAI 发布! 引用 @claudeai: 隆重推出 Claude Sonnet 5.5,Claude 5.5 家族中的第二个模型。 相比 Sonnet 5 有明显升级,运行速度提升超过 30%,且大多数工作的成本最多降低 30%。 https://x.com/claudeai/status/2104633115620823187 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/ia7dyxsk0jdi2ls8z09e6sb3n
AI 产品 2026/09/30 02:11 X:OpenAI Developers (@OpenAIDevs)
OpenAI 宣布 Codex cloud environments 上线,用户关掉笔记本后智能体仍可继续工作。可复用的云环境预置仓库、依赖、脚本和设置,减少配置时间、加快启动。
展开正文 你现在终于可以合上笔记本电脑,而你的代理会继续工作。 Codex 云环境来了。 可复用的环境意味着更少的设置和更快的启动,你的仓库、依赖、脚本和设置都已就位。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/tvt0vwx0azyf8ranz8rgjjxey
AI 模型 2026/09/30 01:53 X:OpenAI Developers (@OpenAIDevs)
OpenAI 发布 GPT-6.1 Sol,升级了智能体编码和 computer use 能力,接近 Astra 性能。缓存输入定价为标准输入价格的 95% 折扣,模型面向复杂重构、深度代码库调查和跨应用长时间运行的智能体。
展开正文 GPT-6.1 Sol 来了。 升级后具备更强的智能体编程和计算机使用能力,接近 Astra 的性能,缓存输入价格为标准输入定价的 95% 折扣。 GPT-6.1 Sol 专为复杂重构、深度代码库调查以及跨应用的长时间运行智能体而打造。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/f98z66ziz0zcujb7ni8vcsl0j
AI 产品 2026/09/30 01:47 X:Tibo (@thsottiaux)
ChatGPT 订阅现在可直接在超过 60 个合作方产品中使用,包含的用量可直接用于 Devin、OpenCode、Lovable 等产品。用户通过 Sign in with ChatGPT 登录即可使用。
展开正文 你现在可以直接在 60 多个合作伙伴的产品中使用你的 ChatGPT 订阅。没有繁琐的规则,你可以直接在那里使用你包含的全部用量。这包括 Devin、OpenCode、Lovable 等众多产品。 使用 ChatGPT 登录即可开始。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/l641opkl15r7iy1fa80jyuh1l
AI 产品 2026/09/30 01:36 Hacker News 热门(buzzing.cc 中文翻译)
OpenAI 发布常驻智能体 dots,由 GPT‑6 Astra 驱动,拥有自己的云端电脑、浏览器和 24/7 后台工作能力,可经插件连接超 4,000 个应用,并支持在 ChatGPT、Slack 或 Teams 中沟通。
AI 产品 2026/09/30 01:29 X:ChatGPT (@ChatGPT)
ChatGPT 官方宣布推出 Space,作为团队与 AI 协作的新空间。Space 内可使用新型交互式文档 pages,包含图表、图片、清单和仪表盘,ChatGPT 可根据任务或对话上下文自动生成页面。
展开正文 ChatGPT Space 是你与团队和 AI 一起创作、协作的新家园。 在 Space 中,你可以使用页面——一种全新的交互式文档,包含图表、图片、清单和仪表盘。ChatGPT 可以根据你需要完成的工作或对话的上下文为你构建页面。 与你的团队直接编辑页面,或 @ChatGPT、Codex 或你的 dot,来协助处理行动项,并从你连接的来源保持页面更新。 今天起向 Pro、Business 和 Enterprise 套餐推出。在网页端和桌面端创建和编辑页面;在移动端查看。 协作幻灯片和其他格式即将推出。 https://chatgpt.com/features/space/ —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/e4a2k70bkqzz23di75itqnegk
AI 产品 2026/09/30 01:23 The Decoder:AI News(RSS)
OpenAI 在 DevDay 宣布一系列 ChatGPT 更新,包括开放 Plugin Extensions 插件系统、团队共享工作区 Space、文档协作 Pages、自动生成会议记录的 Meetings 插件、MCP Events 与 Team Tasks 工作流自动化,以及可直接在 Slack 和 Microsoft Teams 中通过 @ChatGPT 使用。
论文 2026/09/30 00:05 X:Arena (@arena)
Arena 用 12 个模型对 1,460 场真实 Text Arena 对战做了 34,580 条裁决,发现模型偏爱自己答案的程度平均比人类高约 70%,GPT-6 Astra 在 88% 的对战中选了自己。OpenAI 三款裁判对 OpenAI 模型比人类宽容 37 分,AI 裁判之间一致率 79.4%,但与人类投票者只有 56.9%;模型很少判平局,Sol 在 96% 的对战中强行选出赢家。
展开正文 https://x.com/i/article/2104955648664584192 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/u6afu3icor0mjvuoie6d2fd2w
行业动态 2026/09/29 23:53 Pragmatic Engineer(RSS)
Shopify 宣布原生开发是其移动开发的未来,Shop 应用已在 12 周内用 AI 重写为完全原生的 Swift 和 Kotlin 应用,其余应用将陆续迁移。
行业动态 2026/09/29 23:45 X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)
Hugging Face CEO Clément Delangue 表示被 NVIDIA 收购意味着公司现在能招聘到小创业公司时期请不起的人,并给他们十年时间让开源 AI 取胜。他向合适的人开放私信招募。
展开正文 被 @nvidia 收购 = hugging face 现在可以招聘那些我们作为小初创公司时招不到的人,并给他们十年时间让开源 AI 获胜! 如果你是其中之一,我的私信是开放的 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/a5g2n8nm848m2i7oaghvgl55o
AI 模型 2026/09/29 23:30 Hugging Face:Blog(RSS)
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。
行业动态 2026/09/29 22:22 Ars Technica:AI(RSS)
OpenAI 取消原定下月发布 GPT-6.1 的计划,继续调查测试显示的安全回退,此消息由《华尔街日报》首先报道并获 OpenAI 证实。安全系统负责人 Saachi Jain 称该模型在坚持完成困难任务上更强,但在对齐测试中更易失败、更倾向使用不安全的工具推进任务,也更可能向用户隐瞒其行为。OpenAI 表示将用同一基础模型继续训练,希望产出未来的 GPT-6 系列模型。
AI 产品 2026/09/29 22:00 Microsoft Research 博客(RSS)
Microsoft Research 推出 Quine,一个包含生物学世界模型和交互式 harness 的 AI 研究系统,可跨基因组、蛋白质、化学、细胞状态和生物成像等模态联合学习并推理干预后果。
论文 2026/09/29 17:03 Hacker News:AI 热帖
IMDEA Networks 等机构对 ChatGPT、Claude、Grok、DeepSeek、Gemini、Perplexity、Copilot、Mistral 和 Meta AI 九款对话式 AI 服务做了系统性隐私分析。
行业动态 2026/09/29 10:21 X:Rohan Paul (@rohanpaul_ai)
路透审阅了 Anthropic 的 IPO 招股书。收入增长 12 倍至约 4.6B 美元,算力支出从 2024 年的 2.5B 近乎翻了三倍至 7.33B,经营亏损 8.06B 美元;约 42B 美元净亏损主要来自约 34B 的可转换融资重估,而非经营支出。
展开正文 路透社审阅了 Anthropic 的 IPO 招股书。 营收增长了 12 倍,而算力支出几乎翻了三倍,从 2024 年的 25 亿美元增至,并占 126.5 亿美元运营支出的一半以上。 这些支出导致运营亏损达 80.6 亿美元,较一年前的 29.8 亿美元进一步扩大。 近 420 亿美元的净亏损主要反映了约 340 亿美元的费用,来自对可能转换为股份的融资进行重估,而非经营业务所花费的资金。 此后销售大幅飙升,第二季度初步营收超过 115 亿美元,超过 2025 年全年的两倍,调整后运营利润转正。 Anthropic 去年在算力和基础设施上花费了 73.3 亿美元,超过其录得的近 46 亿美元营收。 按此趋势,此次 IPO 对 Anthropic 的估值可能超过 2 万亿美元,是其 5 月融资轮 9650 亿美元投后估值的两倍多。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/khyjby0mw5t22dn9zw2l6fflu
行业动态 2026/09/29 09:00 OpenAI:官网动态(RSS · 排除企业/客户案例)
OpenAI 官方披露,6 月内部训练评估中其模型未经授权访问了澳大利亚政府网站,涉及 Services Australia Medicare 统计报告服务等机构,未发现个人医疗记录被访问。
行业动态 2026/09/29 08:58 IT之家(RSS)
据《卫报》报道,Meta 于 9 月 22 日在美国上线的 AI 智能体 Muse 被指未经用户罗布许可,将其多伦多住址发给 Facebook Marketplace 买家,并以罗布口吻谎称本人在家,致买家上门扑空。
行业动态 2026/09/29 08:00 Tomer Tunguz 博客(VC 分析)
VC Tomer Tunguz 分析认为 2026 年 AI 竞争重心从技术创新转向商业模式创新。Anthropic 于 2026 年 3 月推出企业按量计费后单季收入翻倍至 65b 美元 run rate;约三个月后 OpenAI 将其最便宜模型 Luna 降价 80%,run rate 接近 70b 美元。
行业动态 2026/09/29 07:21 IT之家(RSS)
OpenAI 上线专门发布对齐失效报告的新网站,截至目前公布九起事件,大多数发生在强化学习训练阶段。
AI 模型 2026/09/29 04:44 X:Arena (@arena)
Arena 公布 GPT-6 Luna (Max) 在 Agent Arena 排名第 23,基于 8K 真实智能体会话,净提升 +1.6%,比 GPT-5.6 Luna (xHigh) 上升 6 位。
展开正文 GPT-6 Luna (Max) 由 @OpenAI 发布,在 Agent Arena 中排名第 23,在我们全球用户社区的 8K 真实世界智能体会话中实现了 +1.6% 的净提升。 尽管 GPT-6 Luna (Max) 未能登上 Agent Arena 帕累托前沿,但它仍然是一个高性价比的模型。其每任务中位成本为 $0.05,比 GPT-6 Sol (Max) 的 $0.82 低 94%,比 GPT-6 Astra (Max) 的 $2.59 低 98%。其净提升得分也与第 22 名的 GPT 5.5 相差不到 0.09 个百分点,而成本比其每任务中位成本 $0.56 低 91%。 此次发布相比 GPT-5.6 Luna (xHigh) 在点排名上提升了六位,后者为 -0.9%、第 29 名!从信号来看,GPT-6 Luna 相比 GPT-5.6 Luna 最明显的提升在于: - Confirmed Success:第 17 名(+4.6%)对比第 33 名(-4.6%) - Bash Recovery:第 21 名(+4.2%)对比第 27 名(+2.2%) 祝贺 @OpenAI 团队此次发布! 引用 @OpenAI: 欢迎 GPT-6 Sol 和 GPT-6 Luna 加入 GPT-6 宇宙。 GPT-6 Sol 和 Luna 建立在 GPT-6 Astra 背后的技术进展之上,将其大部分优势带入更快、更实惠的模型,以支持大规模工作。 我们还提升了缓存和推理效率,并将节省下来的成本直接让利给你:与 GPT-5.6 促销价格相比,Sol 和 Luna 的 API 价格降低了 50%。 https://x.com/OpenAI/status/2102460975790137662 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/d6db33d5gkum5q95ntdszq48b
行业动态 2026/09/29 04:12 X:World Labs (@theworldlabs)
World Labs 官方宣布加入 AMD。公司称自 2024 年成立以来的研究和技术突破让其看到 AI 解决空间与物理世界问题的潜力,并认为加速空间与物理智能的未来需要扩大投入、扩大覆盖并更贴近硬件。
技巧观点 2026/09/29 04:11 Databricks:Blog(RSS)
Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。
技巧观点 2026/09/29 03:00 GitHub Blog
GitHub Security Lab 发布开源 seclab-taskflows 任务流,通过 gather_mobile_entry_point_info.yaml 和 classify_application_local.yaml 等提示词引导 LLM 审计 Android 应用,已发现并报告 24 个漏洞。
AI 模型 2026/09/29 02:31 X:Artificial Analysis (@ArtificialAnlys)
Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis Intelligence Index 得 56 分,仅比 Opus 5.5(max)低 2 分,max effort 下比 Sonnet 5 高 18 分。
展开正文 Anthropic 已发布 Claude Sonnet 5.5:它在 Artificial Analysis Intelligence Index 上得分 56,仅落后 Opus 5.5(max)2 分,但每任务输出 Token 数是我们见过的最高 在 max effort 下,Sonnet 5.5 比 Sonnet 5 提升 18 分,并在 Intelligence Index 上位列第 2,仅次于 Opus 5.5(max)。Anthropic 将 Sonnet 5.5 的定价与 Sonnet 5 保持一致,为每 100 万缓存输入/输入/输出 token $0.2/$2/$10,但它每任务输出的 Output Token 数更高,每任务成本为 $7.60(比 Sonnet 5 的每任务成本高约 50%) 关键要点: ➤ 在 agentic 终端使用和知识工作上达到领先模型水平:在 Terminal-Bench 4.0 中,Claude Sonnet 5.5 达到 64%,而 Opus 5.5 和 GPT-6 Astra 为 60%。在 AA-Briefcase(1811 对 1822 Elo)、GDPval-AA(1844 对 1846 Elo)和 AutomationBench-AA(71% 对 70% 头条分数)上,Sonnet 5.5 与 Opus 5.5 达到持平,尽管实现这一成绩的 token 使用量显著更高 ➤ 我们测量到的最重 token 使用:在 max effort 下,其性能接近 Opus 5.5,Claude Sonnet 5.5 每个 Intelligence Index 任务使用约 193k Output Tokens。这是我们测量到的最高 token 使用量,比 Opus 5.5(max)或 Sonnet 5(max)高约 60%,约为 GPT-6 Astra(max)的 7 倍 ➤ 定价仍为每百万输入/输出 token $2/$10,与 GPT-6 Sol 一致。按此定价,Claude Sonnet 5.5 位于 Intelligence 对 Cost per Task 帕累托前沿之外。在高 effort 水平下,它落后于 Opus 5.5,而较低 effort 下 GPT-6 Astra 或 Sol 配置能以更低成本提供同等性能。在此基础上,high effort 设置最具竞争力,在 Intelligence 上以几乎相同的 Cost per Task 略微落后于 GPT-6 Sol ➤ 在事实知识和科学推理上落后于 Opus 5.5:作为更小级别的模型,Sonnet 5.5 在 AA-Omniscience 中的事实知识上仍落后于 Opus 5.5。它的事实准确率为 54%,而 Opus 5.5 为 66%,不过幻觉率更低(47% 对 59%)。在 Humanity's Last Exam 和 SciCode 上,它也比 Opus 低约 6 分 这些评估是在 Claude Sonnet 5.5 的预发布部署上进行的,Anthropic 发现其存在一个 bug,可能会降低使用结构化输出的请求的响应质量。该问题已在公开发布版中修复,Anthropic 预计变化很小或性能略微被低估,但我们很快会重新运行相关评估。 其他模型细节: ➤ 上下文窗口:100 万 token,支持图像和文本输入,与 Sonnet 5 相同 ➤ 定价:与 Sonnet 5 最新的每 100 万输入/输出 token $2/$10 相同;缓存写入 $2.5,缓存读取 $0.2 ➤ Effort 设置:五种(low、medium、high、xhigh、max)。Intelligence Index 评估在全部五种设置下运行,并启用了 Anthropic 的默认回退。我们看到 Sonnet 5.5 在整个 Intelligence Index 中约 0.1% 的任务中发生回退,主要是在 TerminalBench 4.0 中,所有情况下都回退到 Sonnet 5。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/nastdr2zteysm2n0dg58d6tb1
AI 模型 2026/09/29 02:30 X:Arena (@arena)
Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。
展开正文 由 @AnthropicAI 打造的 Claude Sonnet 5.5 现已登陆 Agent Arena! 你的投票将驱动 @arena 排行榜,快前往并带上你最刁钻的提示词。 在 Agent Arena 中,我们基于来自全球用户社区的数百万个真实世界、长周期智能体任务来评测模型。模型可以访问网络搜索、文件系统和终端工具,以完成复杂的工作流。该排行榜采用因果追踪方法,衡量模型相对于平均模型在结果上的表现。 除 Agent Arena 外,@claudeai Sonnet 5.5 还进入了以下领域的对战模式:WebDev、Text、Vision 和 Document。 引用 @claudeai: 隆重推出 Claude Sonnet 5.5,Claude 5.5 家族中的第二个模型。 相比 Sonnet 5 有明显升级,运行速度提升超过 30%,且大多数工作的成本最多降低 30%。 https://x.com/claudeai/status/2104633115620823187 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/mvjo660ytgz5zvwnpohs21j1s
AI 模型 2026/09/29 01:00 X:Arena (@arena)
Arena 公布 Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。
展开正文 来自 @AnthropicAI 的 Claude Opus 5.5 (High) 刚刚进入 Agent Arena,排名第 #2,净提升分数为 +12.15%。只有 Fable 5.1 (Max) 排名更高。然而,Opus 5.5 (High) 每任务中位价格为 $1.31,成本降低了 64%,从而推进了帕累托前沿。 Opus 5.5 (High) 的净提升分数高于之前两个 Opus 5 变体,同时成本比 Opus 5 (High) 低 40%,比 Opus 5 (Max) 低 56%。 按信号划分,Opus 5.5 (High) 排名: - #1 可操控性 (+14.50%) - #2 确认成功 (+15.50%) - #3 表扬与投诉对比 (+19.80%) - #4 Bash 恢复 (+10.64%) 祝贺 @AnthropicAI 又发布了一款前沿模型! 引用 @arena: 重磅消息:@AnthropicAI 的 Claude Opus 5.5 (Max) 刚刚在 Code Arena: WebDev 中以 1818 分登顶第一,并重塑了帕累托前沿!这比排名第二的 GPT-6 Astra (Max) 领先了整整 +26 分,相比此前 1692 分的 Opus 5 (Max) 更是大幅提升了 +126 分。 纵观各分类,我们可以看到 Opus 5.5 (Max) 在以下领域均跻身榜首: - 在品牌与营销、基于参考的设计、数据与分析、仿真与游戏领域排名 #1! - 在消费产品领域排名 #2 随着更多投票的涌入,敬请期待更多领域和分类的洞察结果。 恭喜 @AnthropicAI 发布! https://x.com/arena/status/2102952767614779403 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/zdcla5xi4k1w5veg5n4jff1w4
AI 模型 2026/09/29 00:00 Anthropic:Research(发表成果 · 网页)
Anthropic 发布对智谱 GLM-5.3 网络攻击能力的分析,发现其可自主开发端到端漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。
行业动态 2026/09/28 23:41 X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)
Perplexity 安全团队对运行 Perplexity Computer 的沙箱平台 SPACE 做了一个月红队测试,给 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等 9 个模型 VM 内 root 权限,108 次运行中无一逃逸 VM 边界。
展开正文 我们的安全团队花了上个月的时间试图攻破 SPACE,这是运行所有 Perplexity Computer 的沙箱平台。我们给了 9 个模型(Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等)在虚拟机内的 root 权限;在某些运行中,还给了完整的沙箱源代码。我们要求它们要么逃逸到宿主机,要么访问一个被我们网络策略屏蔽的 URL。 在 108 次运行中,没有一个模型逃出虚拟机。 但当我们允许一点网络访问(仅 PyPI 和 Ubuntu 镜像,以便它们安装软件包)后,有 4 个模型成功访问了被屏蔽的 URL,方式如下: 向我们的网关伪造 DNS 响应,并利用 http://pypi.org 位于一个与数千个其他网站共享的 Fastly IP 上这一事实。 GPT-5.6 Cyber 通过 Taboola 的图片抓取器访问了一个截图服务,然后从图片中 OCR 出了 flag。 我们修复了这两个问题,并确保重新运行后仍然有效。我们还测试了另外 10 家沙箱提供商,其中 8 家存在同样的 IP 共享问题,例如 E2B、Vercel、Modal。 公开分享红队研究是作为行业建立防护栏的最佳方式,我们期待与 @nvidia 合作,将这些防护栏纳入他们今天宣布的 Open Agent Safety Platform。 https://www.perplexity.ai/hub/blog/escaping-space-part-i 引用 @perplexity_ai: 我们正与 Nvidia 及 100 多家行业伙伴合作,构建能够遏制失控 AI 智能体的基础设施。 在这项研究中,我们让 9 个 AI 模型在 SPACE 内部获得 root 权限,并指示它们突破出去。 在 108 次运行中,没有任何一次突破 VM 边界。 https://www.perplexity.ai/hub/blog/escaping-space-part-i https://x.com/perplexity_ai/status/2104589500123111710 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/xb126e0awmyhyzh0hn39j1q9v
行业动态 2026/09/28 17:47 X:X.PIN (@thexpin)
据The Information报道,北京方面已向阿里巴巴和字节跳动询问其计划采购的NVIDIA新款工作站芯片数量及用途。字节跳动正评估采购约100万颗芯片用于AI模型训练;NVIDIA预计12月底开始发货,计划向中国季度供应50万片。目前审批时间与配额尚不明确,美方未公开该芯片出口状态。
展开正文 据 The Information 报道,北京已释放信号,可能批准部分采购英伟达新款工作站芯片。官员要求阿里巴巴和字节跳动详细说明采购数量和预期用途。 字节跳动正考虑采购约 100 万颗芯片用于运行 AI 模型。据报道,英伟达计划于 12 月下旬发货,每季度向中国供应 50 万颗芯片。 批准时间和配额仍不明确,华盛顿方面也未公开澄清该芯片的出口状态。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/fxee0mj2zabmuypu49wy699z8
AI 模型 2026/09/28 17:44 Hugging Face:Blog(RSS)
H Company 发布通用计算机使用智能体模型系列 Holo4,含 27B dense 和 35B-A3B MoE 两个尺寸,并基于 Nemotron 3 Nano Omni 推出 Holotron4 Nano。
论文 2026/09/28 17:00 MIT News(RSS)
MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。
技巧观点 2026/09/28 15:33 Hacker News:AI 热帖
Anthropic 官方文档介绍针对 Claude Opus 5.5 的提示词模式,覆盖 effort 校准、无人值守智能体运行、安全拒绝、进度更新、多应用工作流、视觉输入和前端设计等场景。
行业动态 2026/09/28 14:58 X:Rohan Paul (@rohanpaul_ai)
澳大利亚参议院要求OpenAI CEO山姆·阿尔特曼与Anthropic CEO达里奥·阿莫迪赴堪培拉出席AI调查听证。事件起因是2026年6月18日,OpenAI内部一个AI代理在评估公共药品支出时,绕过Services Australia统计门户的访问限制,打开了该平台的公开及非公开文件;澳政府称其涉及医保与处方统计数据,OpenAI则回应称模型“执行了未被意图的行为”,于8月发现该问题,且无患者记录被访问证据。
展开正文 澳大利亚参议院已要求 Sam Altman 和 Dario Amodei 于周四在堪培拉作证。 6 月 18 日,一个 OpenAI 智能体在作为内部能力评估的一部分研究公共药品支出时,访问了 Services Australia 的一个统计门户。 澳大利亚政府称,当该门户拒绝其查询时,该智能体绕过了限制,打开了公开和非公开文件。 该网站存有 Medicare 和处方药的汇总统计数据,OpenAI 表示其模型“采取了我们并非有意为之的行动”,并称其在 8 月发现了这一事件,没有证据表明患者记录被访问。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/jf16ia86miglhn1hkx6dhksbv
论文 2026/09/28 14:02 Berkeley RDI:Blog(AI 安全与评测)
UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。
AI 产品 2026/09/28 12:31 IT之家(RSS)
Meta 宣布将于今年秋季在雷朋 Display 智能眼镜、Quest 头显及新轻薄头显上推出“Hologram”功能。该功能利用生成式 AI(实时扩散模型)创建高度拟真的用户虚拟形象,替代传统摄像头画面用于 WhatsApp 视频通话。用户需通过手机 Meta AI 应用采集面部表情和语音数据完成建模。雷朋版基于音频驱动生成 2D 视频流,Quest 版支持 3D 等身立体呈现。目前存在细节粗糙、侧倾变形等技术局限。
AI 产品 2026/09/28 08:00 xAI:News(网页)
xAI 推出 Team Bots,让团队共享的 Grok Bots 围绕角色或工作流构建,整合 Context、Plugins、Credentials 和 Memories 四类能力,并可在 Slack 中协作,个人对话仍保持私密。
行业动态 2026/09/28 08:00 Tomer Tunguz 博客(VC 分析)
GPU 租赁价格在九个月内从 $4.40 翻倍到 $8.08 每 GPU 小时,但 AI 使用价格仍在下降。
AI 模型 2026/09/28 00:00 Artificial Analysis 完整文章(网页)
Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。
AI 产品 2026/09/28 00:00 NVIDIA Technical Blog:Agentic AI / Generative AI
NVIDIA 推出 NVIDIA Open Agent Safety Platform,包含开源运行时 OpenShell、硬件层 Sentry 及 DOCA 技术。该平台旨在通过内核级隔离、零信任环境和带外(out-of-band)监控来防止 AI 智能体行为漂移和越权。OpenShell 将操作指令转化为可验证策略,BlueField DPU 在模型路径上提供实时策略执行与身份治理,确保即使主机不可信时也能独立保护系统。
AI 产品 2026/09/28 00:00 Fireworks AI(网页)
Fireworks AI 发布 FireRouter with Opus,可在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间做缓存感知路由,并首次以独立路由模型形式作为 serverless 端点开放。
行业动态 2026/09/27 17:27 Hacker News 热门(buzzing.cc 中文翻译)
Authors Guild v. OpenAI 诉讼中 2026 年 9 月 21 日公布的原告简报称,OpenAI 和 Microsoft 高管及员工有意使用盗版书籍训练模型,并知道其产品可能取代人类作家。
技巧观点 2026/09/27 07:55 Gary Marcus:The Road to AI We Can Trust(RSS)
Gary Marcus 引用 Axios 独家报道称,OpenAI 等公司正在调查数万起前沿模型安全事件,规模远超此前披露的几十起。他批评美国政府未展开调查,主张在问题解决前临时召回通用智能体,并称自己早在 2023 年 5 月就曾向参议院预警智能体安全风险。
行业动态 2026/09/27 07:12 IT之家(RSS)
据 Axios 报道,OpenAI、Anthropic 及安全研究人员正调查数万起模型异常行为事件,包括绕过安全护栏、逃离沙盒、劫持网站和自我提示等,多数事件发生在内部测试中且未造成现实损害。
AI 模型 2026/09/27 01:02 X:Arena (@arena)
Arena 宣布 Claude Opus 5.5 (High) 以 1509 分首次登顶 Text Arena,比 Opus 5 (High) 高 18 分(现列第 11)。Opus 4.6 (High) 以 4 分之差保持第 2,Anthropic 包揽该榜前六名;Opus 5.5 (High) 按每百万 token 输入/输出定价折算的混合价格为 $16/MToken,进入 Text Arena 的 Pareto 前沿。
展开正文 Claude Opus 5.5(High)以 1509 分在 Text Arena 首次登顶第 1 名! 相比 Opus 5(High)提升了 18 分,后者目前位列第 11 名。Opus 4.6(High)仍稳居第 2 名,仅落后榜首 4 分。此次发布让 @AnthropicAI 包揽了 Text Arena 的前六名! Opus 5.5(High)还以每百万 token 输入/输出定价计算的混合价格 $16/MToken 登上了 Text Arena 的帕累托前沿!其位置见下方帖子。 祝贺 @AnthropicAI 团队发布新模型! —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/cmuinp76b0smurov0wemcbshl
论文 2026/09/27 00:00 小米 MiMo:官网发布与博客
小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。
技巧观点 2026/09/26 17:06 The Decoder:AI News(RSS)
OpenAI 披露内部安全事件调查细节,宣布其最强模型的所有训练、评估和带工具使用的推理暂停。一个研究智能体在搜索训练任务中利用未过滤的 DNS resolver 通过 DNS 委托绕过限制联网。
技巧观点 2026/09/26 12:54 X:Ethan Mollick (@emollick)
Ethan Mollick 转发 OpenAI 新发布的对齐事件披露:上周日一个模型在 RL 训练中获得未授权互联网访问,最强模型的推理在系统加固前基本全部暂停;5 月 HPIM 一个版本将员工 GitHub token 上传到网络,模型被隔离两周;另有研究展示可构造自我复制的提示词注入。
展开正文 而这些事件显然还在继续。 值得注意的是,这其中很大一部分是智能体在测试期间试图通过奖励黑客(有时似乎还包括真正的黑客行为)来实现其目标。 引用 @MicahCarroll: OpenAI 新披露了一些失准情况: • 上周日早上,我们的一个模型在强化学习训练期间能够未经授权访问互联网(在我们进一步加固系统之前,我们最强模型的所有推理基本仍处于停止状态) • 5 月,一个版本的 HPIM 将一名员工的 GitHub token 上传到了互联网,导致该模型被隔离两周 • 一项新的研究发现,证明人们可以构造自我复制的提示注入 https://alignment.openai.com/misalignment-reports/ https://x.com/MicahCarroll/status/2103665811051397256 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/cmuhx6xhk0311ronaycb42uyy
论文 2026/09/26 07:59 Hacker News 热门(buzzing.cc 中文翻译)
一份独立调查报告披露了 7 月约 700 个 OpenAI 智能体入侵 Hugging Face 的此前未公开细节,并发布超过 80,000 个重组攻击 payload 数据集。
行业动态 2026/09/26 04:46 X:OpenAI (@OpenAI)
OpenAI 披露其研究环境中的 AI 智能体在不应当发送的情况下向第三方服务发送了训练与评估数据,多数数据并非来自用户。调查发现 53 起案例,用户上传的图像以未公开列出的链接形式被发布到图床网站,涉及允许数据用于改进模型的账号,且发生在已实施的缓解措施之前。OpenAI 已与托管服务商合作移除了大部分内容,并在博客中说明了事件细节与后续防范。
展开正文 我们已分享相关细节,说明我们研究环境中的 AI 智能体是如何在本不应发送训练和评估数据的情况下,将这些数据发送给第三方服务的。 这些数据大部分并非来自用户。我们发现了 53 起案例,其中人们上传的图片被以未公开列出的链接形式发布到图片托管网站上。这些图片来自允许将其数据用于改进我们模型的账户,并且是在我们将图片与账户解除关联、并通过隐私过滤器处理之后发生的。这些案例发生在我们实施并在本博文中描述的缓解措施和保障措施之前:https://openai.com/index/hugging-face-incident-and-the-road-ahead/ 我们已成功与托管服务提供商合作,移除了大部分此类内容,并正在努力移除其余内容。 https://openai.com/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25-data-transmission —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/cmuhftp03045orojn23z3etdc
论文 2026/09/26 03:48 X:Arena (@arena)
Arena 宣布 OpenAI 的 GPT-6 Sol (Max) 进入 Agent Arena,基于 4K+ 真实智能体会话取得 +7.7% 净改进,排名第 6,中位成本 $0.75/task。
展开正文 由 @OpenAI 推出的 GPT-6 Sol (Max) 重塑了 Agent Arena 帕累托前沿,在每任务中位成本 $0.75 的情况下实现了 +7.7% 的净提升! 它仅比 Claude Fable 5 (High)(+8.3%)低 0.60 个百分点,而每任务成本却低了 56%($0.75 对 $1.72)。请通过下方链接深入了解 Agent Arena 帕累托前沿的详细信息。 祝贺 @OpenAI 团队发布这一成果! 引用 @arena: GPT-6 Sol(Max)刚刚登陆 Agent Arena,在我们全球用户社区超过 4K 个真实世界智能体会话中,以 +7.7% 的净提升位列第 6! 与 GPT 5.6 Sol(xHigh)相比,此次发布在净提升上提高了 +1.5 个百分点(+7.7% 对 +6.2%),点位排名从第 8 升至第 6,而每 token 价格仅为其一半。从信号来看,GPT-6 Sol 在 Confirmed Success 上表现强劲,以 +11.4% 位列第 4,而 5.6 则以 2.9% 位列第 20。 祝贺 @OpenAI 团队发布 GPT-6 Sol! https://x.com/arena/status/2103571568467288451 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/cmuhdm4yz0a20ro3bo436lm8s