GPT-6刷到99.9%,ARC AGI考卷被迫重做!下一关考「发明」
GPT-6刷到99.9%,ARC AGI考卷被迫重做!下一关考「发明」AI把考卷刷到接近满分,下一张,还能考什么?
搜索
AI把考卷刷到接近满分,下一张,还能考什么?
忍!不!了!了! 你老A社天天一会儿AI要失控、一会儿互联网要完蛋,转头自己IPO、融资、扩算力,一个都没耽误??
北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。
大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
网友将HHMI Janelia和Google Research发布的果蝇大脑神经图谱MaleCNS接入AI,让虚拟苍蝇玩《超级马里奥64》《反恐精英2》《艾尔登法环》等游戏、在Coinbase炒币、识别日文平假名、参加虚拟MMA格斗,甚至操控多足机器人。
让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为: 递归自我改进(Recursive Self-Improvement,RSI)。
最新消息,特朗普对马斯克、Dario Amodei和奥特曼的「减速避险」计划大发雷霆!
前几天,著名外宾AI应用 Genspark 干了一件以前不太像它会干的事。
有了AI,现在的学生,真的是不得了—— 仅仅耗时4天时间,就做出了一个AI短片,然后直接斩获一等奖,拿下30000元!
当个性化Agentic RL遇上现实用户平台场景时,一直存在一个常见难点:面对同样的query,不同用户往往偏好不同的规划策略、工具调用和最终表达。