今年外滩最特别Agent:能干活,能陪聊,还会朋友圈拉黑你
今年外滩最特别Agent:能干活,能陪聊,还会朋友圈拉黑你还得是外滩大会,真!热!闹!啊!
搜索
还得是外滩大会,真!热!闹!啊!
当个性化Agentic RL遇上现实用户平台场景时,一直存在一个常见难点:面对同样的query,不同用户往往偏好不同的规划策略、工具调用和最终表达。
Genspark 发布基于 MiniMax M3 后训练的自有品牌 PPT 模型 Gen-1 Slides,标志着这家曾被比作"AI Costco"的应用公司开始从组合外部模型转向在开源基座上训练专用模型。
安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。
元空智能联合惠普发布端侧AI方案,推出涵盖27B稠密与35B-A3B稀疏版本的Boxer系列模型以及AI Work、AI Science两套Agent,主张"设备即环境"理念,强调原生端侧模型才是AI未来发展方向。
OpenAI Codex团队主张模型越强Harness应越轻量,Anthropic Claude Code团队则认为模型越强Harness反而需越复杂以支撑Agent长时间自主运行,两者共同揭示了Agent Harness正经历从辅助层向承重结构转变的结构性变化。
Shengtao Guo、Ethan X. Fang和Junwei Lu署名的预印本论文宣称利用Odin Automatic AI Research Agent证明了悬而未决40年的Komlós猜想并给出常数界3√(2π),次日陶哲轩等25位菲尔兹奖得主发表联合声明《AI在数学中的严重失准》,警告AI证明速度已远超学界验证与消化的能力。
浙江大学与上海交通大学团队提出Deep Academic Survey(DAS),通过Stateful Agentic框架与DAS-2M文献元数据库,可在1小时内自动生成面向发表的学术综述,在DAS-Bench 30个主题评测中平均得分4.34,并已开放220篇完整Survey供查看。
基元律动发布的Agent原生模型NeoHorse-1上线三天即在Hugging Face下载量突破1.2万次,并获AK在X推荐及魔搭ModelScope官方推荐,社区开发者已制作出面向Apple Silicon的MLX量化版本。
OpenAI发布Agents API,将Codex背后的Harness能力拆解为云端托管服务对外开放,开发者只需指定任务、模型、工具和运行环境即可创建Agent,标志着Codex从单一产品升级为可复用的平台。