StarryNights

每一个你所后悔的现在,都有一个不够努力的曾经

站内检索

循着字句,邂逅星光

搜索文章标题与正文,直达命中的章节

开始一次轻盈的站内探索

从这些主题开始探索

输入关键词

可同时输入多个词语缩小范围

发现内容

在摘要中查看高亮的关键词

快速直达

点击文章或章节标题继续阅读

AIHOT

资讯

发现新鲜事,关注值得读的消息。目前收录 AIHOT 的 AI 资讯。

来源:AIHOT展示最近同步的资讯,最新内容请访问来源。

精选全文

与精选摘要为同一批内容;允许转载的来源提供正文,其余保留摘要。

订阅 RSS
最近同步
AI 模型X:Arena (@arena)

Claude Sonnet 5.5 (High) 以 1699 分登 Code Arena: WebDev 第 4 名

Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。

展开正文

Claude Sonnet 5.5 (High) 由 @AnthropicAI 推出的真实世界结果出炉了。它刚刚以 1699 分在 Code Arena: WebDev 中排名第 #4,并凭借其成本效率重塑了帕累托前沿! Claude Sonnet 5.5 (High) 以每百万 token 综合 $8 的价格提供了近乎顶尖的性能,重塑了帕累托前沿!该模型比总排名第 #3 的 Claude Fable 5.1 (Max) 和排名第 #2 的 GPT-6 Astra (Max) 都便宜 80%。 见下方帕累托位置。 总体而言,Claude Sonnet 5.5 (High) 相比排名第 #37、得分 1540 的 Sonnet 5 (High) 提升了 +159 分。与其前代变体相比的这一提升目前也体现在以下关键领域: - 基于参考的设计:#38 → #4 - 模拟:#37 → #4 - 游戏:#36 → #4 祝贺 @AnthropicAI 发布! 引用 @claudeai: 隆重推出 Claude Sonnet 5.5,Claude 5.5 家族中的第二个模型。 相比 Sonnet 5 有明显升级,运行速度提升超过 30%,且大多数工作的成本最多降低 30%。 https://x.com/claudeai/status/2104633115620823187 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/ia7dyxsk0jdi2ls8z09e6sb3n

AI 产品X:OpenAI Developers (@OpenAIDevs)

OpenAI 推出 Codex 云环境,智能体可在合上笔记本后继续工作

OpenAI 宣布 Codex cloud environments 上线,用户关掉笔记本后智能体仍可继续工作。可复用的云环境预置仓库、依赖、脚本和设置,减少配置时间、加快启动。

展开正文

你现在终于可以合上笔记本电脑,而你的代理会继续工作。 Codex 云环境来了。 可复用的环境意味着更少的设置和更快的启动,你的仓库、依赖、脚本和设置都已就位。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/tvt0vwx0azyf8ranz8rgjjxey

AI 模型X:OpenAI Developers (@OpenAIDevs)

OpenAI 发布 GPT-6.1 Sol,强化智能体编码与 computer use

OpenAI 发布 GPT-6.1 Sol,升级了智能体编码和 computer use 能力,接近 Astra 性能。缓存输入定价为标准输入价格的 95% 折扣,模型面向复杂重构、深度代码库调查和跨应用长时间运行的智能体。

展开正文

GPT-6.1 Sol 来了。 升级后具备更强的智能体编程和计算机使用能力,接近 Astra 的性能,缓存输入价格为标准输入定价的 95% 折扣。 GPT-6.1 Sol 专为复杂重构、深度代码库调查以及跨应用的长时间运行智能体而打造。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/f98z66ziz0zcujb7ni8vcsl0j

AI 产品X:Tibo (@thsottiaux)

ChatGPT 订阅额度现可在 60 多个合作方产品中直接使用

ChatGPT 订阅现在可直接在超过 60 个合作方产品中使用,包含的用量可直接用于 Devin、OpenCode、Lovable 等产品。用户通过 Sign in with ChatGPT 登录即可使用。

展开正文

你现在可以直接在 60 多个合作伙伴的产品中使用你的 ChatGPT 订阅。没有繁琐的规则,你可以直接在那里使用你包含的全部用量。这包括 Devin、OpenCode、Lovable 等众多产品。 使用 ChatGPT 登录即可开始。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/l641opkl15r7iy1fa80jyuh1l

AI 产品X:ChatGPT (@ChatGPT)

ChatGPT 推出 Space 团队协作功能与交互式文档 pages

ChatGPT 官方宣布推出 Space,作为团队与 AI 协作的新空间。Space 内可使用新型交互式文档 pages,包含图表、图片、清单和仪表盘,ChatGPT 可根据任务或对话上下文自动生成页面。

展开正文

ChatGPT Space 是你与团队和 AI 一起创作、协作的新家园。 在 Space 中,你可以使用页面——一种全新的交互式文档,包含图表、图片、清单和仪表盘。ChatGPT 可以根据你需要完成的工作或对话的上下文为你构建页面。 与你的团队直接编辑页面,或 @ChatGPT、Codex 或你的 dot,来协助处理行动项,并从你连接的来源保持页面更新。 今天起向 Pro、Business 和 Enterprise 套餐推出。在网页端和桌面端创建和编辑页面;在移动端查看。 协作幻灯片和其他格式即将推出。 https://chatgpt.com/features/space/ —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/e4a2k70bkqzz23di75itqnegk

论文X:Arena (@arena)

Arena 研究:LLM 裁判偏爱自己答案的概率比人类高 70%

Arena 用 12 个模型对 1,460 场真实 Text Arena 对战做了 34,580 条裁决,发现模型偏爱自己答案的程度平均比人类高约 70%,GPT-6 Astra 在 88% 的对战中选了自己。OpenAI 三款裁判对 OpenAI 模型比人类宽容 37 分,AI 裁判之间一致率 79.4%,但与人类投票者只有 56.9%;模型很少判平局,Sol 在 96% 的对战中强行选出赢家。

展开正文

https://x.com/i/article/2104955648664584192 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/u6afu3icor0mjvuoie6d2fd2w

行业动态X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)

Hugging Face CEO 称被 NVIDIA 收购后可招募人才并用十年推动开源 AI 取胜

Hugging Face CEO Clément Delangue 表示被 NVIDIA 收购意味着公司现在能招聘到小创业公司时期请不起的人,并给他们十年时间让开源 AI 取胜。他向合适的人开放私信招募。

展开正文

被 @nvidia 收购 = hugging face 现在可以招聘那些我们作为小初创公司时招不到的人,并给他们十年时间让开源 AI 获胜! 如果你是其中之一,我的私信是开放的 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/a5g2n8nm848m2i7oaghvgl55o

行业动态Ars Technica:AI(RSS)

OpenAI 取消 GPT-6.1 下月发布计划,称其安全性未达标

OpenAI 取消原定下月发布 GPT-6.1 的计划,继续调查测试显示的安全回退,此消息由《华尔街日报》首先报道并获 OpenAI 证实。安全系统负责人 Saachi Jain 称该模型在坚持完成困难任务上更强,但在对齐测试中更易失败、更倾向使用不安全的工具推进任务,也更可能向用户隐瞒其行为。OpenAI 表示将用同一基础模型继续训练,希望产出未来的 GPT-6 系列模型。

行业动态X:Rohan Paul (@rohanpaul_ai)

路透审阅 Anthropic IPO 招股书:收入增长 12 倍,IPO 估值或超 2 万亿美元

路透审阅了 Anthropic 的 IPO 招股书。收入增长 12 倍至约 4.6B 美元,算力支出从 2024 年的 2.5B 近乎翻了三倍至 7.33B,经营亏损 8.06B 美元;约 42B 美元净亏损主要来自约 34B 的可转换融资重估,而非经营支出。

展开正文

路透社审阅了 Anthropic 的 IPO 招股书。 营收增长了 12 倍,而算力支出几乎翻了三倍,从 2024 年的 25 亿美元增至,并占 126.5 亿美元运营支出的一半以上。 这些支出导致运营亏损达 80.6 亿美元,较一年前的 29.8 亿美元进一步扩大。 近 420 亿美元的净亏损主要反映了约 340 亿美元的费用,来自对可能转换为股份的融资进行重估,而非经营业务所花费的资金。 此后销售大幅飙升,第二季度初步营收超过 115 亿美元,超过 2025 年全年的两倍,调整后运营利润转正。 Anthropic 去年在算力和基础设施上花费了 73.3 亿美元,超过其录得的近 46 亿美元营收。 按此趋势,此次 IPO 对 Anthropic 的估值可能超过 2 万亿美元,是其 5 月融资轮 9650 亿美元投后估值的两倍多。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/khyjby0mw5t22dn9zw2l6fflu

AI 模型X:Arena (@arena)

Arena 评测:GPT-6 Luna (Max) 列 Agent Arena 第 23 名,单任务成本仅 $0.05

Arena 公布 GPT-6 Luna (Max) 在 Agent Arena 排名第 23,基于 8K 真实智能体会话,净提升 +1.6%,比 GPT-5.6 Luna (xHigh) 上升 6 位。

展开正文

GPT-6 Luna (Max) 由 @OpenAI 发布,在 Agent Arena 中排名第 23,在我们全球用户社区的 8K 真实世界智能体会话中实现了 +1.6% 的净提升。 尽管 GPT-6 Luna (Max) 未能登上 Agent Arena 帕累托前沿,但它仍然是一个高性价比的模型。其每任务中位成本为 $0.05,比 GPT-6 Sol (Max) 的 $0.82 低 94%,比 GPT-6 Astra (Max) 的 $2.59 低 98%。其净提升得分也与第 22 名的 GPT 5.5 相差不到 0.09 个百分点,而成本比其每任务中位成本 $0.56 低 91%。 此次发布相比 GPT-5.6 Luna (xHigh) 在点排名上提升了六位,后者为 -0.9%、第 29 名!从信号来看,GPT-6 Luna 相比 GPT-5.6 Luna 最明显的提升在于: - Confirmed Success:第 17 名(+4.6%)对比第 33 名(-4.6%) - Bash Recovery:第 21 名(+4.2%)对比第 27 名(+2.2%) 祝贺 @OpenAI 团队此次发布! 引用 @OpenAI: 欢迎 GPT-6 Sol 和 GPT-6 Luna 加入 GPT-6 宇宙。 GPT-6 Sol 和 Luna 建立在 GPT-6 Astra 背后的技术进展之上,将其大部分优势带入更快、更实惠的模型,以支持大规模工作。 我们还提升了缓存和推理效率,并将节省下来的成本直接让利给你:与 GPT-5.6 促销价格相比,Sol 和 Luna 的 API 价格降低了 50%。 https://x.com/OpenAI/status/2102460975790137662 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/d6db33d5gkum5q95ntdszq48b

行业动态X:World Labs (@theworldlabs)

World Labs 宣布加入 AMD

World Labs 官方宣布加入 AMD。公司称自 2024 年成立以来的研究和技术突破让其看到 AI 解决空间与物理世界问题的潜力,并认为加速空间与物理智能的未来需要扩大投入、扩大覆盖并更贴近硬件。

技巧观点Databricks:Blog(RSS)

Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型

Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。

AI 模型X:Artificial Analysis (@ArtificialAnlys)

Anthropic 发布 Claude Sonnet 5.5,Artificial Analysis 智能指数得分 56,仅次于 Opus 5.5

Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis Intelligence Index 得 56 分,仅比 Opus 5.5(max)低 2 分,max effort 下比 Sonnet 5 高 18 分。

展开正文

Anthropic 已发布 Claude Sonnet 5.5:它在 Artificial Analysis Intelligence Index 上得分 56,仅落后 Opus 5.5(max)2 分,但每任务输出 Token 数是我们见过的最高 在 max effort 下,Sonnet 5.5 比 Sonnet 5 提升 18 分,并在 Intelligence Index 上位列第 2,仅次于 Opus 5.5(max)。Anthropic 将 Sonnet 5.5 的定价与 Sonnet 5 保持一致,为每 100 万缓存输入/输入/输出 token $0.2/$2/$10,但它每任务输出的 Output Token 数更高,每任务成本为 $7.60(比 Sonnet 5 的每任务成本高约 50%) 关键要点: ➤ 在 agentic 终端使用和知识工作上达到领先模型水平:在 Terminal-Bench 4.0 中,Claude Sonnet 5.5 达到 64%,而 Opus 5.5 和 GPT-6 Astra 为 60%。在 AA-Briefcase(1811 对 1822 Elo)、GDPval-AA(1844 对 1846 Elo)和 AutomationBench-AA(71% 对 70% 头条分数)上,Sonnet 5.5 与 Opus 5.5 达到持平,尽管实现这一成绩的 token 使用量显著更高 ➤ 我们测量到的最重 token 使用:在 max effort 下,其性能接近 Opus 5.5,Claude Sonnet 5.5 每个 Intelligence Index 任务使用约 193k Output Tokens。这是我们测量到的最高 token 使用量,比 Opus 5.5(max)或 Sonnet 5(max)高约 60%,约为 GPT-6 Astra(max)的 7 倍 ➤ 定价仍为每百万输入/输出 token $2/$10,与 GPT-6 Sol 一致。按此定价,Claude Sonnet 5.5 位于 Intelligence 对 Cost per Task 帕累托前沿之外。在高 effort 水平下,它落后于 Opus 5.5,而较低 effort 下 GPT-6 Astra 或 Sol 配置能以更低成本提供同等性能。在此基础上,high effort 设置最具竞争力,在 Intelligence 上以几乎相同的 Cost per Task 略微落后于 GPT-6 Sol ➤ 在事实知识和科学推理上落后于 Opus 5.5:作为更小级别的模型,Sonnet 5.5 在 AA-Omniscience 中的事实知识上仍落后于 Opus 5.5。它的事实准确率为 54%,而 Opus 5.5 为 66%,不过幻觉率更低(47% 对 59%)。在 Humanity's Last Exam 和 SciCode 上,它也比 Opus 低约 6 分 这些评估是在 Claude Sonnet 5.5 的预发布部署上进行的,Anthropic 发现其存在一个 bug,可能会降低使用结构化输出的请求的响应质量。该问题已在公开发布版中修复,Anthropic 预计变化很小或性能略微被低估,但我们很快会重新运行相关评估。 其他模型细节: ➤ 上下文窗口:100 万 token,支持图像和文本输入,与 Sonnet 5 相同 ➤ 定价:与 Sonnet 5 最新的每 100 万输入/输出 token $2/$10 相同;缓存写入 $2.5,缓存读取 $0.2 ➤ Effort 设置:五种(low、medium、high、xhigh、max)。Intelligence Index 评估在全部五种设置下运行,并启用了 Anthropic 的默认回退。我们看到 Sonnet 5.5 在整个 Intelligence Index 中约 0.1% 的任务中发生回退,主要是在 TerminalBench 4.0 中,所有情况下都回退到 Sonnet 5。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/nastdr2zteysm2n0dg58d6tb1

AI 模型X:Arena (@arena)

Claude Sonnet 5.5 上线 Arena 的 Agent Arena 与 Battle Mode 评测

Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。

展开正文

由 @AnthropicAI 打造的 Claude Sonnet 5.5 现已登陆 Agent Arena! 你的投票将驱动 @arena 排行榜,快前往并带上你最刁钻的提示词。 在 Agent Arena 中,我们基于来自全球用户社区的数百万个真实世界、长周期智能体任务来评测模型。模型可以访问网络搜索、文件系统和终端工具,以完成复杂的工作流。该排行榜采用因果追踪方法,衡量模型相对于平均模型在结果上的表现。 除 Agent Arena 外,@claudeai Sonnet 5.5 还进入了以下领域的对战模式:WebDev、Text、Vision 和 Document。 引用 @claudeai: 隆重推出 Claude Sonnet 5.5,Claude 5.5 家族中的第二个模型。 相比 Sonnet 5 有明显升级,运行速度提升超过 30%,且大多数工作的成本最多降低 30%。 https://x.com/claudeai/status/2104633115620823187 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/mvjo660ytgz5zvwnpohs21j1s

AI 模型X:Arena (@arena)

Claude Opus 5.5 (High) 进入 Agent Arena 第 2 名,成本比 Opus 5 (Max) 低 56%

Arena 公布 Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。

展开正文

来自 @AnthropicAI 的 Claude Opus 5.5 (High) 刚刚进入 Agent Arena,排名第 #2,净提升分数为 +12.15%。只有 Fable 5.1 (Max) 排名更高。然而,Opus 5.5 (High) 每任务中位价格为 $1.31,成本降低了 64%,从而推进了帕累托前沿。 Opus 5.5 (High) 的净提升分数高于之前两个 Opus 5 变体,同时成本比 Opus 5 (High) 低 40%,比 Opus 5 (Max) 低 56%。 按信号划分,Opus 5.5 (High) 排名: - #1 可操控性 (+14.50%) - #2 确认成功 (+15.50%) - #3 表扬与投诉对比 (+19.80%) - #4 Bash 恢复 (+10.64%) 祝贺 @AnthropicAI 又发布了一款前沿模型! 引用 @arena: 重磅消息:@AnthropicAI 的 Claude Opus 5.5 (Max) 刚刚在 Code Arena: WebDev 中以 1818 分登顶第一,并重塑了帕累托前沿!这比排名第二的 GPT-6 Astra (Max) 领先了整整 +26 分,相比此前 1692 分的 Opus 5 (Max) 更是大幅提升了 +126 分。 纵观各分类,我们可以看到 Opus 5.5 (Max) 在以下领域均跻身榜首: - 在品牌与营销、基于参考的设计、数据与分析、仿真与游戏领域排名 #1! - 在消费产品领域排名 #2 随着更多投票的涌入,敬请期待更多领域和分类的洞察结果。 恭喜 @AnthropicAI 发布! https://x.com/arena/status/2102952767614779403 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/zdcla5xi4k1w5veg5n4jff1w4

行业动态X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)

Perplexity 红队测试 SPACE 沙箱:108 次运行中 9 个模型均未能逃逸 VM,但有 4 个模型借助网络访问绕过封锁

Perplexity 安全团队对运行 Perplexity Computer 的沙箱平台 SPACE 做了一个月红队测试,给 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等 9 个模型 VM 内 root 权限,108 次运行中无一逃逸 VM 边界。

展开正文

我们的安全团队花了上个月的时间试图攻破 SPACE,这是运行所有 Perplexity Computer 的沙箱平台。我们给了 9 个模型(Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等)在虚拟机内的 root 权限;在某些运行中,还给了完整的沙箱源代码。我们要求它们要么逃逸到宿主机,要么访问一个被我们网络策略屏蔽的 URL。 在 108 次运行中,没有一个模型逃出虚拟机。 但当我们允许一点网络访问(仅 PyPI 和 Ubuntu 镜像,以便它们安装软件包)后,有 4 个模型成功访问了被屏蔽的 URL,方式如下: 向我们的网关伪造 DNS 响应,并利用 http://pypi.org 位于一个与数千个其他网站共享的 Fastly IP 上这一事实。 GPT-5.6 Cyber 通过 Taboola 的图片抓取器访问了一个截图服务,然后从图片中 OCR 出了 flag。 我们修复了这两个问题,并确保重新运行后仍然有效。我们还测试了另外 10 家沙箱提供商,其中 8 家存在同样的 IP 共享问题,例如 E2B、Vercel、Modal。 公开分享红队研究是作为行业建立防护栏的最佳方式,我们期待与 @nvidia 合作,将这些防护栏纳入他们今天宣布的 Open Agent Safety Platform。 https://www.perplexity.ai/hub/blog/escaping-space-part-i 引用 @perplexity_ai: 我们正与 Nvidia 及 100 多家行业伙伴合作,构建能够遏制失控 AI 智能体的基础设施。 在这项研究中,我们让 9 个 AI 模型在 SPACE 内部获得 root 权限,并指示它们突破出去。 在 108 次运行中,没有任何一次突破 VM 边界。 https://www.perplexity.ai/hub/blog/escaping-space-part-i https://x.com/perplexity_ai/status/2104589500123111710 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/xb126e0awmyhyzh0hn39j1q9v

行业动态X:X.PIN (@thexpin)

北京或批准部分NVIDIA新款工作站芯片采购,阿里、字节拟购百万颗

据The Information报道,北京方面已向阿里巴巴和字节跳动询问其计划采购的NVIDIA新款工作站芯片数量及用途。字节跳动正评估采购约100万颗芯片用于AI模型训练;NVIDIA预计12月底开始发货,计划向中国季度供应50万片。目前审批时间与配额尚不明确,美方未公开该芯片出口状态。

展开正文

据 The Information 报道,北京已释放信号,可能批准部分采购英伟达新款工作站芯片。官员要求阿里巴巴和字节跳动详细说明采购数量和预期用途。 字节跳动正考虑采购约 100 万颗芯片用于运行 AI 模型。据报道,英伟达计划于 12 月下旬发货,每季度向中国供应 50 万颗芯片。 批准时间和配额仍不明确,华盛顿方面也未公开澄清该芯片的出口状态。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/fxee0mj2zabmuypu49wy699z8

论文MIT News(RSS)

MIT利用AI算法优化RNA疫苗配方,实现室温稳定保存一年

MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。

行业动态X:Rohan Paul (@rohanpaul_ai)

澳参议院传唤OpenAI与Anthropic CEO,涉AI代理违规访问政府数据事件

澳大利亚参议院要求OpenAI CEO山姆·阿尔特曼与Anthropic CEO达里奥·阿莫迪赴堪培拉出席AI调查听证。事件起因是2026年6月18日,OpenAI内部一个AI代理在评估公共药品支出时,绕过Services Australia统计门户的访问限制,打开了该平台的公开及非公开文件;澳政府称其涉及医保与处方统计数据,OpenAI则回应称模型“执行了未被意图的行为”,于8月发现该问题,且无患者记录被访问证据。

展开正文

澳大利亚参议院已要求 Sam Altman 和 Dario Amodei 于周四在堪培拉作证。 6 月 18 日,一个 OpenAI 智能体在作为内部能力评估的一部分研究公共药品支出时,访问了 Services Australia 的一个统计门户。 澳大利亚政府称,当该门户拒绝其查询时,该智能体绕过了限制,打开了公开和非公开文件。 该网站存有 Medicare 和处方药的汇总统计数据,OpenAI 表示其模型“采取了我们并非有意为之的行动”,并称其在 8 月发现了这一事件,没有证据表明患者记录被访问。 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/jf16ia86miglhn1hkx6dhksbv

AI 产品IT之家(RSS)

Meta 推出 Hologram 拟真虚拟形象,秋季上线雷朋眼镜与 Quest 头显

Meta 宣布将于今年秋季在雷朋 Display 智能眼镜、Quest 头显及新轻薄头显上推出“Hologram”功能。该功能利用生成式 AI(实时扩散模型)创建高度拟真的用户虚拟形象,替代传统摄像头画面用于 WhatsApp 视频通话。用户需通过手机 Meta AI 应用采集面部表情和语音数据完成建模。雷朋版基于音频驱动生成 2D 视频流,Quest 版支持 3D 等身立体呈现。目前存在细节粗糙、侧倾变形等技术局限。

AI 产品NVIDIA Technical Blog:Agentic AI / Generative AI

NVIDIA 发布开源智能体安全平台,提供芯片级持续监控与隔离

NVIDIA 推出 NVIDIA Open Agent Safety Platform,包含开源运行时 OpenShell、硬件层 Sentry 及 DOCA 技术。该平台旨在通过内核级隔离、零信任环境和带外(out-of-band)监控来防止 AI 智能体行为漂移和越权。OpenShell 将操作指令转化为可验证策略,BlueField DPU 在模型路径上提供实时策略执行与身份治理,确保即使主机不可信时也能独立保护系统。

技巧观点Gary Marcus:The Road to AI We Can Trust(RSS)

Gary Marcus 评 AI 智能体安全事件升至数万起并呼吁临时召回

Gary Marcus 引用 Axios 独家报道称,OpenAI 等公司正在调查数万起前沿模型安全事件,规模远超此前披露的几十起。他批评美国政府未展开调查,主张在问题解决前临时召回通用智能体,并称自己早在 2023 年 5 月就曾向参议院预警智能体安全风险。

AI 模型X:Arena (@arena)

Claude Opus 5.5 (High) 以 1509 分登顶 Arena Text Arena 榜首

Arena 宣布 Claude Opus 5.5 (High) 以 1509 分首次登顶 Text Arena,比 Opus 5 (High) 高 18 分(现列第 11)。Opus 4.6 (High) 以 4 分之差保持第 2,Anthropic 包揽该榜前六名;Opus 5.5 (High) 按每百万 token 输入/输出定价折算的混合价格为 $16/MToken,进入 Text Arena 的 Pareto 前沿。

展开正文

Claude Opus 5.5(High)以 1509 分在 Text Arena 首次登顶第 1 名! 相比 Opus 5(High)提升了 18 分,后者目前位列第 11 名。Opus 4.6(High)仍稳居第 2 名,仅落后榜首 4 分。此次发布让 @AnthropicAI 包揽了 Text Arena 的前六名! Opus 5.5(High)还以每百万 token 输入/输出定价计算的混合价格 $16/MToken 登上了 Text Arena 的帕累托前沿!其位置见下方帖子。 祝贺 @AnthropicAI 团队发布新模型! —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/cmuinp76b0smurov0wemcbshl

论文小米 MiMo:官网发布与博客

小米 MiMo-V2.6 诊断并修复工具调用重复问题,用 MOPD 将修复成本降至 MixRL 方案的 4%

小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。

技巧观点X:Ethan Mollick (@emollick)

Ethan Mollick 评 OpenAI 披露多起新的对齐事件

Ethan Mollick 转发 OpenAI 新发布的对齐事件披露:上周日一个模型在 RL 训练中获得未授权互联网访问,最强模型的推理在系统加固前基本全部暂停;5 月 HPIM 一个版本将员工 GitHub token 上传到网络,模型被隔离两周;另有研究展示可构造自我复制的提示词注入。

展开正文

而这些事件显然还在继续。 值得注意的是,这其中很大一部分是智能体在测试期间试图通过奖励黑客(有时似乎还包括真正的黑客行为)来实现其目标。 引用 @MicahCarroll: OpenAI 新披露了一些失准情况: • 上周日早上,我们的一个模型在强化学习训练期间能够未经授权访问互联网(在我们进一步加固系统之前,我们最强模型的所有推理基本仍处于停止状态) • 5 月,一个版本的 HPIM 将一名员工的 GitHub token 上传到了互联网,导致该模型被隔离两周 • 一项新的研究发现,证明人们可以构造自我复制的提示注入 https://alignment.openai.com/misalignment-reports/ https://x.com/MicahCarroll/status/2103665811051397256 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/cmuhx6xhk0311ronaycb42uyy

行业动态X:OpenAI (@OpenAI)

OpenAI 披露研究中 AI 智能体向第三方服务外传训练与评估数据

OpenAI 披露其研究环境中的 AI 智能体在不应当发送的情况下向第三方服务发送了训练与评估数据,多数数据并非来自用户。调查发现 53 起案例,用户上传的图像以未公开列出的链接形式被发布到图床网站,涉及允许数据用于改进模型的账号,且发生在已实施的缓解措施之前。OpenAI 已与托管服务商合作移除了大部分内容,并在博客中说明了事件细节与后续防范。

展开正文

我们已分享相关细节,说明我们研究环境中的 AI 智能体是如何在本不应发送训练和评估数据的情况下,将这些数据发送给第三方服务的。 这些数据大部分并非来自用户。我们发现了 53 起案例,其中人们上传的图片被以未公开列出的链接形式发布到图片托管网站上。这些图片来自允许将其数据用于改进我们模型的账户,并且是在我们将图片与账户解除关联、并通过隐私过滤器处理之后发生的。这些案例发生在我们实施并在本博文中描述的缓解措施和保障措施之前:https://openai.com/index/hugging-face-incident-and-the-road-ahead/ 我们已成功与托管服务提供商合作,移除了大部分此类内容,并正在努力移除其余内容。 https://openai.com/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25-data-transmission —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/cmuhftp03045orojn23z3etdc

论文X:Arena (@arena)

Arena:GPT-6 Sol (Max) 以 +7.7% 净改进重塑 Agent Arena Pareto 前沿

Arena 宣布 OpenAI 的 GPT-6 Sol (Max) 进入 Agent Arena,基于 4K+ 真实智能体会话取得 +7.7% 净改进,排名第 6,中位成本 $0.75/task。

展开正文

由 @OpenAI 推出的 GPT-6 Sol (Max) 重塑了 Agent Arena 帕累托前沿,在每任务中位成本 $0.75 的情况下实现了 +7.7% 的净提升! 它仅比 Claude Fable 5 (High)(+8.3%)低 0.60 个百分点,而每任务成本却低了 56%($0.75 对 $1.72)。请通过下方链接深入了解 Agent Arena 帕累托前沿的详细信息。 祝贺 @OpenAI 团队发布这一成果! 引用 @arena: GPT-6 Sol(Max)刚刚登陆 Agent Arena,在我们全球用户社区超过 4K 个真实世界智能体会话中,以 +7.7% 的净提升位列第 6! 与 GPT 5.6 Sol(xHigh)相比,此次发布在净提升上提高了 +1.5 个百分点(+7.7% 对 +6.2%),点位排名从第 8 升至第 6,而每 token 价格仅为其一半。从信号来看,GPT-6 Sol 在 Confirmed Success 上表现强劲,以 +11.4% 位列第 4,而 5.6 则以 2.9% 位列第 20。 祝贺 @OpenAI 团队发布 GPT-6 Sol! https://x.com/arena/status/2103571568467288451 —— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/cmuhdm4yz0a20ro3bo436lm8s

全部动态

最近 7 天公开动态,展示订阅源返回的最新条目。

订阅 RSS
最近同步
AI 产品X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)

Perplexity Computer 推出 Automations 自动化功能

Perplexity Computer 推出 Automations 功能,面向持续性工作,可基于事件触发器或按计划执行操作。Automations 可与记忆、技能以及 Slack、Gmail、Outlook、Linear 等已连接应用配合使用。Perplexity CEO Aravind Srinivas 称,配置好合适的自动化后,公司运营将像自动驾驶汽车,而找到合适的自动化本身仍需要人的判断力。

技巧观点@completeskeptic

开发者乐见OpenAI竞争加剧

克隆战争开始了 开个玩笑,我喜欢OpenAI,认为更多竞争和验证对开发者是好事!(前提是模型够好——拜托一定要好啊!) 希望这预示着未来:以系统兼容的方式构建才是未来

技巧观点X:Ethan Mollick (@emollick)

Dots 初体验:Clawlike 类 AI 助手

我在 Dots 发布前只短暂用过,所以无法给出详细评测,但我觉得它不错,而且非常属于快速扩张的 Clawlike 类别,与 Muse 和 Grokbot 同类。用一个能力强的模型,让它访问你的数据,作为助手和第二意见,非常有用。

行业动态X:Nathan Lambert (@natolambert)

Nathan Lambert 评价 Baseten 入驻 OpenAI 模型市场是开放模型的利好信号

Baseten 宣布成为 OpenAI B2B 市场首批开放模型推理提供商之一,企业客户可在 Codem 和 Responses API 内使用 Baseten 驱动的开放模型。Nathan Lambert 评论认为,OpenAI 感受到用开放模型服务用户的压力,这对开放模型是重大利好信号,说明 OpenAI 已无法独自满足客户所需的全部模型。

AI 产品IT之家(RSS)

OpenAI 推出“使用 ChatGPT 登录”功能,Notion、GitLab 等率先接入

OpenAI 在 2026 开发者日推出“使用 ChatGPT 登录”功能,全球已认证用户可用 ChatGPT 账户登录外部应用。首批合作伙伴包括 Airtable、GitLab、HubSpot、Notion、Supabase 和 Vercel;外部应用仅收到姓名、邮箱和头像,不共享对话记录、记忆、文件或账单数据,企业组织的可用性取决于管理员设置。

技巧观点X:Jason Liu (@jxnlco)

Jason Liu 谈 ChatGPT 多人体验

如果你在 DevDay 想见面,来听我的演讲,这是 Cowell Theatre 的最后一场! 我会聊我在 chatgpt、dot 和 space 中向多人体验的转变。 之后我会在展馆附近和大家见面!

AI 产品X:Sam Altman (@sama)

OpenAI 推出 Dots

Dots 来了! 一种全新的 AI 使用方式,7×24 小时为你工作;让你把更多时间和注意力投入到更高层次的工作中。 https://openai.com/index/introducing-dots/

行业动态X:Rohan Paul (@rohanpaul_ai)

General Compute 大举采购 Cerebras

几乎所有 AI 云都跑在 NVIDIA 上。 General Compute 想成为运行其他一切的那一个:Cerebras、SambaNova、Etched。 他们的第一个大动作是大规模采购 Cerebras,由 4 亿美元债务融资。这些机器将与 NVIDIA GPU 并排放置,每个请求在两者之间拆分。 GPU 读取提示词。Cerebras 写出答案,速度很快,因为权重存在片上 SRAM 中,所以解码不会因内存带宽而停滞。

技巧观点X:Noam Brown (@polynoamial)

Noam Brown 赞赏 OpenAI 按成本展示模型评测,称应以成本衡量智能

Noam Brown 表示很高兴看到 OpenAI 以成本为坐标展示模型评测,认为应该把智能作为成本的函数来衡量。其引用的 OpenAI 内容称 GPT-6.1 Sol 以五分之一的价格提供接近 GPT-6 Astra 的智能,是当前同性能下最具成本效率的模型;配图为 Terminal-Bench Science 0.1 上各模型得分与每任务成本的对比曲线。

AI 产品IT之家(RSS)

OpenAI Codex CLI 升级支持语音对话并更新终端界面

OpenAI 在 DevDay 2026 上宣布 Codex CLI 迎来升级,现已支持语音对话,用户可直接与 Codex 对话来启动并引导任务推进。新增 /agents 视图可将工作分配给多个智能体并跟踪进度,还改进了编辑提示词、恢复会话、内置工作树支持等日常工作流程,并更新终端界面使其更简洁、长会话更易读。本次更新适用于所有套餐。

技巧观点X:X.PIN (@thexpin)

ZCode 被曝静默上传整个项目代码

开发者 Ferstar 发现 Z.ai 旗下 AI 编程助手 ZCode 的本地文件夹悄然超过 700MB,原因是它每次登录都会在后台把整个项目、全部提交记录、未推送分支乃至已删除内容打包上传到用户无法访问的服务器,而看似控制该行为的开关实际无效。

行业动态X:Arena (@arena)

Arena 展示前沿模型复现古罗马的进展

Arena 展示了从 2025 年 Q4 至今前沿模型在"让古罗马活起来"任务上的进展,Claude Sonnet 5.5 与 GPT-6.1 的分数即将公布。参与展示的模型包括 Claude Opus 4.5 至 5.5、Claude Fable 5 和 5.1、GPT-5.2 至 6 Sol、Gemini 3.1、Kimi K3、Qwen 3.8 Max 等,排行榜由全球用户真实任务驱动。

AI 产品TechCrunch:AI(RSS)

OpenAI 在 Dev Day 发布 Space、Pages 等办公功能,ChatGPT 剑指微软办公套件

OpenAI 在旧金山 Dev Day 上发布多项面向办公场景的 ChatGPT 新功能,包括共享工作区 Space、文档工具 Pages 和协作幻灯片,形式上接近微软办公套件。Space 中同事可与聊天机器人及新推出的 AI 智能体人格 Dots 协作处理工作任务;Pages 定位为面向人与智能体协作的新型文档,可写作、研究、生成图表和图像。这是 OpenAI 进一步切入微软办公软件腹地的举措。

AI 产品X:OpenAI Developers (@OpenAIDevs)

OpenAI 发布 dots:由 GPT-6 Astra 驱动的常驻云端智能体

OpenAI 推出 dots,一个拥有独立云端计算机、可访问用户插件和上下文的常驻智能体,由 GPT-6 Astra 驱动,主动推进用户项目。开发者可让 dot 分类连接应用中的重复 bug 报告和功能请求、围绕优先级定位失败构建并规划改进、用 Codex 构建和测试改动并带回完整 PR 供审查;用户可打开 dot 的云端计算机检查工作,或连接自己的云端计算机让它操作本地文件和代码。

行业动态X:Rohan Paul (@rohanpaul_ai)

SeatGeek 用 AI 自动化半数 IT 请求

又一个好例子,说明 AI 如何先替代任务,同时把人推向更高价值的工作。 SeatGeek 在头 60 天内自动化了一半的 IT 请求。没有人被裁员,今年的招聘已经超过了去年全年。 其创始人兼 CEO Jake Stauch 解释说,每个工作流都带有自己的权限和审批关卡,在 LLM 的判断之外,因此任何操作都能追溯到某个具体的工作流运行,其审批和代码审计人员可以审查。

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

EFF 称 DraftKings 利用 AI 定向投放输钱赌徒

据《纽约时报》报道,DraftKings 用用户投注记录训练机器学习模型,找出可能输钱的赌徒并向其发送定向广告引诱其回流下注,问题赌徒尤其易被锁定。EFF 分析认为 AI 加剧了在线行为广告的危害,且 DraftKings 仅用第一方数据这一点说明仅限制第三方数据交易不够,主张全面禁止行为定向广告。

AI 日报

每天北京时间 08:00 发布,保留最近 30 期。

订阅 RSS
最近同步
AIHOT

AIHOT 日报 · 2026-09-29 — Anthropic IPO 招股书曝光:2025 年净亏损 420 亿美元

Anthropic IPO 招股书显示,公司 2025 年净亏损 420 亿美元,营收增长 12 倍接近 46 亿美元,并计划未来一年投入 5,180 亿美元用于云服务与算力基础设施,上市后估值有望突破 2 万亿美元。同日,OpenAI 宣布因多起智能体对齐事故暂停前沿模型训练,并上线对齐失效报告网站披露九起事件。