正面Pk美国普罗米修斯!比特无限击败全球团队拿下ECCV 2026 CAD Challenge
正面Pk美国普罗米修斯!比特无限击败全球团队拿下ECCV 2026 CAD Challenge近日,ECCV 2026 官方 CAD Challenge 最新榜单公布,比特无限联合武汉大学团队,凭借自研智能体系统取得 96.39 分的成绩,击败其余 27 家全球队伍,拿下全球第一。
搜索
近日,ECCV 2026 官方 CAD Challenge 最新榜单公布,比特无限联合武汉大学团队,凭借自研智能体系统取得 96.39 分的成绩,击败其余 27 家全球队伍,拿下全球第一。
两个月前,GPT-5.6 Sol闯下大祸。
长文、网页、视频和代码经常停在这样的「半成品」状态:海报文案没有写错,却挤出了页面;网站首屏很漂亮,按钮点下去毫无反应;视频里的镜头单看都成立,连起来却丢了人物和节奏;程序刚修好一个模块,另一处又出现回归。
让 Agent 完成一个任务并不难。它会整理材料、修改文件、检查结果,再交付答案。
一句话概括:文本世界模型都在比 "生成文本像不像真实环境",但我们发现文本更接近真实环境的预测反而可能让智能体错得更离谱。把训练目标从 "状态一致" 换成 "行为一致" 后,16 组实验配置下世界模型的轨迹级一致性几乎全面提升,弱智能体离线评测的假阳性率从 42.5% 降到 9.5%。
过去几年,端侧大模型一直在不断突破能力边界。
先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。
AI行业最性感的故事一直在天上:更大的模型、更聪明的Agent、更接近AGI的能力,每隔几个月就把技术的天花板再往上顶一点。
过去一段时间,TiDB 团队启动了一项面向 Agent 的基础设施尝试——TiDB Cloud Filesystem。它把 Workspace 从 Session 和 Sandbox 的生命周期中独立出来:Agent 仍然通过熟悉的文件系统接口工作,背后则提供数据库级的持久化、版本、分支、回滚和权限控制。
OpenAI被曝正在内部测试GPT-6 Sol,单次速度约为GPT-6 Astra的6倍,同时公开内部数据称研究员每8小时工作日背后并行运行约3.1个Agent工作日、每日Agent推理资源花费超600美元,并宣布已实现"自动化AI研究实习生"目标;其首席科学家Jakub Pachocki同日发文警告AI对齐与监控难题,表示若必要OpenAI不排除单方面暂停扩大模型规模。