ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维
ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35%。
搜索
7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35%。
一项机器人拼搭长城的展示火爆全网。从彩排现场的照片来看,围观者已经里三层外三层。原力灵机联合阶跃星辰,用 6 台机器人挑战 15 小时连续作业,搭建完成一座包含超 8 万个零件的长城模型 —— 最小组件不到 1 厘米宽,成品长 3.5 米、宽 1.5 米、高 1.1 米。其中 4 台桌面机器人负责精细零件的拼装,2 台轮式机器人 Apex 负责将拼装完成的组件运输、组装。
曾推出 RoboTwin 系列基准的团队发布了 RoboDojo,一套统一覆盖仿真与真实机器人操作的具身智能评测体系。它包含 42 个仿真任务、18 个真实机器人任务,并将 30 个代表性机器人策略放到同一套标准下比较。
随后,SpaceXAI 兑现了承诺,在 GitHub 上正式开源了这套智能体编程框架。该公司在一篇 X 帖子中表示:“开源 Grok Build 可以让任何人都能参与构建可靠且强大的框架。”开源不到 20 个小时,Grok Build 已在 GitHub 上收获 1.21 万颗 Star。
今天凌晨看到 Arena AI 更新 Code Arena 榜单时,我第一反应是有点意外。刚刚发布的 Kimi K3 拿到了 1679 分,排在全球第一,压过了 Claude Fable 5 的 1631 分和 GPT-5.6 Sol 的 1618 分。
8万块积木,15个小时!
刚刚,机器人顶会RSS 2026论文奖项出炉!
7 月 16 日,月之暗面正式发布 Kimi K3:总参数量 2.8 万亿(2.8T),原生视觉理解,100 万 token 上下文,并且——开源权重。这是历史上第一个摸到 2.8 万亿参数量级的开源模型。前任"开源最大模型"的纪录保持者?也是它自己。
号外号外,OpenAI最新提示词指南更新了!如果你还没驯服ChatGPT,或者还在被它像毛线团一样越理越乱的回答折腾得苦不堪言,那么今天这篇OpenAI最新提示词指南,你一定要好好收藏!
刚刚,网信中国发布公告,「Apple 智能」正式通过生成式人工智能服务备案。 和苹果一起「持证上岗」的还有华为小艺 AI 大模型、OPPO AndesGPT、vivo 蓝心端侧大模型、小米澎湃 AI、三星盖乐世 AI 和努比亚豆包手机大模型,一共 7 款手机端侧大模型在 7 月 8 日集体过审。