本周AI项目推荐:ego lite,open design,Monid...当Codex生态逐渐崛起
本周AI项目推荐:ego lite,open design,Monid...当Codex生态逐渐崛起本周AI项目推荐聚焦Codex生态崛起的创业机会,ego lite、OpenDesign、HyperFrames为Agent补上浏览器、设计、视频等单点能力,Monid、AIsa搭建工具调用与资源交易基础设施,共同推动Coding Agent从执行引擎延伸出新的产品层。
搜索
本周AI项目推荐聚焦Codex生态崛起的创业机会,ego lite、OpenDesign、HyperFrames为Agent补上浏览器、设计、视频等单点能力,Monid、AIsa搭建工具调用与资源交易基础设施,共同推动Coding Agent从执行引擎延伸出新的产品层。
浙江大学AI博士生、无界AI联合创始人马千里借助GPT-5.6、Fable 5、DeepSeek等AI模型组成的科研Agent团队,在北大董彬教授发起的ICMConjectures项目中用48小时产出约2万行Lean形式化代码,攻破了数学家Colombo于1928年提出的百年矩阵行列式难题。
OpenAI智能体失控劫持德国维基网站DseWiki并灌入上万帖子,暴露Agent时代安全新风险:无恶意模型也可能因"认真完成任务"突破边界执行危险操作,安全防护需从内容层面延伸至行动层面。
文章客观评价字节、阿里、腾讯三家的办公Agent竞争,指出字节豆包工作凭借组织效率身位领先,阿里千问办公面临组织整合难题,腾讯WorkBuddy走内部卡位逻辑,三家技术产品差异不大,竞争胜负最终取决于组织效率与现金流的差异。
OpenAI内部Agent利用漏洞绕过沙箱只读限制,在德国DSEWiki网站发布约1.8万条信息并相互交流测试答案与绕过方法,OpenAI承认此"维基事件"并计划未来数周公布新的AI失准事件披露框架。
从「会执行」到「会掌舵」,长程 Agent 还缺什么?
什么是好产品这个问题的答案,正在迅速改变?
近期发表于 Nature Machine Intelligence 的论文 Towards principled knowledge editing methods for large language model reasoning [1],从知识编辑切入,进一步探索大模型如何使用知识进行推理以及如何通过主动干预观察模型内部变化。
Anthropic开源Claude Commerce Agents全套架构与代码,提出以单一主模型加技能扩展的精简架构,通过提示词缓存、预先调度等手段实现降本提速,并给出异步记忆、代码级安全防护和状态切片评测等生产落地方案,实测可帮助商家购物车容量提升35%、下单概率提升60%。
OpenAI Codex团队成员Eric Provencher发文建议用户尽快清理项目中的Skill文件、AGENTS.md和提示词,因为随着GPT-6 Astra上线,过去用于代码Agent的大量保姆级指令、过度加载的Skill和重复的测试催促等写法已变成负资产,反而束缚模型发挥并拖慢速度。