万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环Transformer与隐藏的思维链
万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环Transformer与隐藏的思维链过去两周里,「循环深度」这个词变成了 AI 安全讨论的焦点。
搜索
过去两周里,「循环深度」这个词变成了 AI 安全讨论的焦点。
成立才一个多月,估值就要冲到 500 亿美元。
刚刚,生数上线了最新的 实时视频模型 S2,输出提高到 720p,保持 25—42 FPS,包含下面两款:
大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
Token词元替代了Byte字节,但不意味着大模型都得是Token。
真实家庭任务往往从「不完整的信息」开始:机器人不知道目标在哪里,用户也未必能一次说清自己想要什么。面对「帮我从餐桌上拿点零食」这样的模糊指令,机器人不仅要主动寻找候选物体,还要在发现面包和多个甜甜圈后进一步询问用户,确认究竟该拿哪一个。
多轮智能体任务只有一个终点奖励,但在一条包含搜索、工具调用和多轮决策的轨迹里,决定成败的往往是一个不起眼的查询词、动作或对象选择。
「人类造的最后一个 AI」还有多远?OpenAI、Anthropic 等头部厂商进度如何?定义中国 RSI 的 roadmap——前沿 AI 研究机构 Theseus Labs 结合 72 家产业实践,推出「RSI 五级框架」
今天的AI Agent,已经不只是聊天窗口里「会说话」的模型。它们正在接入浏览器、文件系统、终端、API、MCP服务和各种自动化工作流,开始真正替用户执行任务。
让 AI 帮忙发一封邮件,它可能把正文写得妥帖、附件整理得齐全,最后却发错了人。
众所周知,现在的大模型基本每隔 35 天左右就会换一轮。
让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为: 递归自我改进(Recursive Self-Improvement,RSI)。
大语言模型智能体正越来越多地进入长期陪伴聊天这类场景 —— 不再答完一个问题就走,而是和用户处成一段长久的关系。
理解生成统一模型(Unified Multimodal Models, UMMs)正在成为多模态模型的重要发展方向。相比传统的理解模型 + 生成模型,UMM 希望在同一个模型中同时完成视觉理解和图像生成,让文本和图像能够在统一上下文中被理解、推理和生成。
Astra,每天都有新新闻。昨天攻克 A,今天攻克 B,明天可能要一起解决 CDE……进步之快,让人目不暇接。而就算你目力过人,你可能也看不懂 Astra 在做啥了。
新智元报道 你敢信? 人没上大学,研究已经接上了「菲尔兹奖得主」的工作了。 就在今天,UCLA数学圈传出了一条让所有人震惊的消息—— 两名高中生Aayush Bathija和Prince Rohatg
同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。
MiniMax H3 的服务是一个系统问题。一个请求要经过一个庞大的 Qwen3-VL 编码器、一个长序列的音视频 DiT、相互独立的视频与音频 VAE、设备与进程的边界,最后还要完成 H.264/AAC 的封装。只优化 DiT,其余环节的时延依然留在那里。
物理AI,正在成为2026年全球人工智能最关键的赛道,也是未来之争。
当个性化Agentic RL遇上现实用户平台场景时,一直存在一个常见难点:面对同样的query,不同用户往往偏好不同的规划策略、工具调用和最终表达。
过去一年,具身智能的技术迭代明显加快。VLA、世界模型持续演进,强化学习重新成为机器人学习的重要技术路径,Sim2Real加速从仿真走向真机,全身控制能力也在快速突破。
如今的 AI 已经能顺畅地帮你写代码、跑实验、做评估。算法工程师的每一天,几乎变成了:让 LLM 整理昨天的实验结果,让 LLM 实现新想法,让 LLM 监控实验运行…… 似乎只需把需求告诉 AI,它就能完成大部分算法工作。
清华大学与北京邮电大学联合提出物理引导扩散模型Channel-Diff,将传播模型、阴影遮挡与多径几何嵌入条件扩散模型,实现无线信道多尺度RSRP预测,在两套真实数据集上相较次优方法分别取得37.19%和25.15%的综合性能提升。
Shengtao Guo、Ethan X. Fang和Junwei Lu署名的预印本论文宣称利用Odin Automatic AI Research Agent证明了悬而未决40年的Komlós猜想并给出常数界3√(2π),次日陶哲轩等25位菲尔兹奖得主发表联合声明《AI在数学中的严重失准》,警告AI证明速度已远超学界验证与消化的能力。
浙江大学与上海交通大学团队提出Deep Academic Survey(DAS),通过Stateful Agentic框架与DAS-2M文献元数据库,可在1小时内自动生成面向发表的学术综述,在DAS-Bench 30个主题评测中平均得分4.34,并已开放220篇完整Survey供查看。
9月10日,生数科技在外滩大会发布面向灵巧操作的自进化通用世界模型Motus2,首次将策略、仿真器与评估器统一于同一模型,实现"行动—预测—评估—反馈"闭环,五项真机任务平均成功率84%。
针对世界模型定义的分歧,李飞飞将其分为渲染器、模拟器和规划器,朱军及生数科技团队则提出理解、想象、行动三项核心能力与五级进化路线图,Motus2通过策略、模拟器、评估器一体化架构推动机器人行动闭环自进化。
第一篇AI4AI综述论文将long horizon智能体、AI4AI与recursive self-improvement纳入同一研究地图,指出AI能在明确目标与评价规则下承担部分研发工作,但单项能力提升无法证明完整流程可靠,持续自我改进仍面临组合鸿沟等验证挑战。
清华大学AI Agent课题组提出加速扩散语言模型单元测试生成的框架DiffuTester,通过抽象语法树动态挖掘多个测试用例间的共享结构模式,在解码过程中保留相关token,在保持测试覆盖率的同时实现最高约2–3倍加速,相关论文已被EMNLP 2026接收。
openJiuwen首发双维度RSI框架,在WorkSwarm蜂群办公智能体上落地Harness与Artifacts双维度优化,支持科研论文和算法程序两类交付产物迭代,并依托昇腾算力亲和能力降低多轮优化的时延与资源开销。