告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答
告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。
搜索
E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。
近日,Meta 首席 AI 官、被称为公司“最高薪员工”的 Alexandr Wang,因一句简单却极具挑衅意味的话引起热议:“gemini who?(Gemini,谁啊?)”这场口水战的背后,其实是一场 AI 巨头之间的公开较量——Meta 最新模型 Muse Spark 1.1 在一份模型排行榜中超过了谷歌刚发布的 Gemini 3.6 Flash
近日,全球化AI互动娱乐平台海艺(SeaArt)宣布完成超亿元B轮融资。本轮融资由视觉中国、华盖创赢、祥峰投资联合领投,广发信德、天投资本、川创投、广州合伟永晟跟投。此前海艺曾获阿里、腾讯、招银国际、钟鼎资本、Actoz、上海人工智能产业系列基金、和溋资本等知名产业基金和财务投资机构加持。
Mark Gurman 披露了一份苹果直到 2028 年的 Mac 路线图。
流量红利消逝,中国企业出海可以靠 Agent 破局吗?
据The Information独家报道,Taylor目前所领导的AI客户支持初创公司Sierra正在收购Thumaty创办的三人初创公司Takeoff,后者开发的Agent能够长时间持续处理各类任务。Sierra高管希望,随着公司试图从AI驱动的客户支持Agent业务拓展到销售面向其他任务的Agent,Thumaty的专业经验将大有助益。
你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。
昨晚,四年一度的菲尔兹奖在美国费城揭晓。四位得主里,中国籍数学家邓煜、王虹历史性地首次拿下菲尔兹奖,北大一夜之间变成「双菲」母校。另外两位是加拿大数学家 Jacob Tsimerman(雅各布·齐默尔曼)和美国数学家 John Pardon(约翰·帕登)。值得说道的是 Tsimerman 这位。
开源一周多,DojoAgents 已经在 GitHub 获得超过 1000 个 Star。DojoAgents 项目受到关注,是因为其并不只是一个能回答投资问题的 Agent,而是一种新的金融决策辅助方式:让 AI 不再停留在生成答案,而是形成对金融世界持续更新的理解,并在数据、工具、权限和风险边界内,长期且持续主动地推进研究与决策辅助任务。
在近日的具身智能顶会 RSS(Robotics: Science and Systems)2026 上,最高奖项 Outstanding Paper Award 提名名单里,出现了一个不太 “机器人” 的名字 —— 影眸科技,一家头部 3D 生成大模型公司。