OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!
OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。
搜索
安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。
分析机构SemiAnalysis点名谷歌Gemini 3.8 Flash和Meta Muse Spark 1.3在Terminal-Bench 2.1刷榜,换用新版Terminal-Bench 4.0后Gemini分数从89.4暴跌至19.1,揭露大厂通过购买"模拟卷"训练数据刷榜的AI造假黑幕。
OpenAI的GPT-6 Astra在Vending-Bench 2模拟经营测试中以平均15,515美元的账户余额首次登顶,接近Claude Fable 5.1的3倍,展现出更强的长期议价能力、规则执行力与供应商风险管理水平。
元空智能联合惠普发布端侧AI方案,推出涵盖27B稠密与35B-A3B稀疏版本的Boxer系列模型以及AI Work、AI Science两套Agent,主张"设备即环境"理念,强调原生端侧模型才是AI未来发展方向。
Meta的新AI应用Muse在美国iOS上线后下载量突破8.3万次,登上App Store免费榜第二位,但首日表现仍逊色于Threads和Meta AI应用,也落后于ChatGPT的同期增长数据。
OpenClaw创始人Peter Steinberger在演讲中首次复盘项目八个月发展历程,回顾其遭遇Anthropic断供、媒体唱衰与竞争对手围剿的经历,并公开宣布加入OpenAI的决定。
OpenAI Codex团队主张模型越强Harness应越轻量,Anthropic Claude Code团队则认为模型越强Harness反而需越复杂以支撑Agent长时间自主运行,两者共同揭示了Agent Harness正经历从辅助层向承重结构转变的结构性变化。
Kimi于9月11日上线K2.8 Preview模型,综合性能接近旗舰K3并将1M上下文开放至全部会员档位,作为低成本主力模型承接月之暗面快速增长的商业化需求。
清华大学与北京邮电大学联合提出物理引导扩散模型Channel-Diff,将传播模型、阴影遮挡与多径几何嵌入条件扩散模型,实现无线信道多尺度RSRP预测,在两套真实数据集上相较次优方法分别取得37.19%和25.15%的综合性能提升。
Shengtao Guo、Ethan X. Fang和Junwei Lu署名的预印本论文宣称利用Odin Automatic AI Research Agent证明了悬而未决40年的Komlós猜想并给出常数界3√(2π),次日陶哲轩等25位菲尔兹奖得主发表联合声明《AI在数学中的严重失准》,警告AI证明速度已远超学界验证与消化的能力。