Agent正确率从26%飙到70%,最近爆火的EvoX有东西啊
Agent正确率从26%飙到70%,最近爆火的EvoX有东西啊Agent 出现这么久了,大伙应该对它们的工作方式也不陌生了吧?
搜索
Agent 出现这么久了,大伙应该对它们的工作方式也不陌生了吧?
这两年Agent领域冒出来的Engineering越来越多。
模型竞争的下一站,是让智能体在真实世界里可执行、可验证、可进化。
如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。
视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。
已经被苹果打入冷宫三年的 Touch Bar,最近意外迎来事业上的「第二春」。
大模型越来越强之后,企业究竟愿意为什么样的AI付钱?
现在的 AI 生图有点太强,像 images 2.0 这样的模型,一段 Prompt 敲进去,直接逼真到你怀疑现实的一切。
图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 5.1 多项基准测试超越上一代,缓存读取成本降低 75%,典型任务整体费用降低约 25%、高 Agent 化任务最高降低约 45%,Mythos 5.1 则面向经审核的高风险领域合作伙伴提供更宽松能力并采用更严格的访问控制。