一群 AI Native 创始人,正在长出来
一群 AI Native 创始人,正在长出来这几天,我们把一群平均年龄只有 19 岁的人召集到一起。几天之后,我们意识到,这可能是一次提前到来的未来。他们来自不同地方,有人做模型、做 agent、做机器人,有人做硬件、做开发者工具,有人还在上学,有人则已经在真实产品里承担核心工作。这里面有一批人已经站在今天 AI 最前沿的地方,参与过很多人正在使用、讨论、追赶的基座模型。
搜索
这几天,我们把一群平均年龄只有 19 岁的人召集到一起。几天之后,我们意识到,这可能是一次提前到来的未来。他们来自不同地方,有人做模型、做 agent、做机器人,有人做硬件、做开发者工具,有人还在上学,有人则已经在真实产品里承担核心工作。这里面有一批人已经站在今天 AI 最前沿的地方,参与过很多人正在使用、讨论、追赶的基座模型。
2026年6月,硅谷。Anthropic的年化营收在过去12个月里翻了五倍多,达到470亿美元。四大科技巨头今年的AI资本开支指引合计超过7000亿美元,接近全球电信行业总投入的两倍。
北大团队雪梦未来(SnowOrigin)获龚虹嘉、陆奇及海外机构投资。公司以神经腕带、全景头环等可穿戴设备为入口,结合自研NMH(Neural Math Hybrid)AI 解码模型,试图将人类真实操作过程中的意图、姿态、发力趋势、微控制及环境上下文,转化为可用于机器人、世界模型和具身智能训练的结构化数据。
如果是小白第一次上手,我会更建议从 Kimi 开始。Kimi 的中文理解、长文本处理、Coding、多模态综合能力都很强,是最适合 Codex 的国产模型。今天这篇内容,手把手教大家如何将第三方大模型接入 Codex 搞定日常任务。
最近《在超市后门抽烟的二人》这部剧挺火的,尤其是里面的音乐我很喜欢,所以就想着做一个真人版音乐短片,正好发现美图旗下的 MVLAND 上线了创意画布模式,接入 Seedance2.0、可灵、HappyHorse 等顶尖视频生成模型。
还在用 DragGAN、DragDiffusion 拖拽修图?点选拖拽容易变形、边界割裂、细节丢失的时代落幕了!ECCV 2026 ICRDrag 首创上下文区域拖拽模型,用掩码精准定位局部区域,移动、缩放、变形全都丝滑自然,兼顾精准度与画面真实感。
近日,上海AI Lab等团队提出了一种面向专业软件智能体的新范式——ComAct(COM-as-Action)。它的核心思想在于:不再把鼠标点击和键盘输入作为Agent的action,而是让Agent直接生成COM代码,通过软件底层对象模型操纵真实专业软件。
vLLM 社区推出的 Semantic Router 除了专注上面三个方向,正在更进一步:我们认为:router 不只是选择模型,还可以提升模型能力。用户不用改权重,也不用让每个 Agent 团队都自己搭一套 Graph,而是在一次普通 Model API 调用的内部,组织出一支有边界、有预算、有验证、有回退的 “小队”。
今天来好好盘点 2026 年上半年的图片与视频模型,伴随模型更新时间轴出现的,还有我一些当时的测试文章。也算是对不怎么努力也没什么收获的上半年做个总结汇报了。
浙江大学等五所高校的研究团队提出 EgoTSR。研究从第一人称机器人视角出发,希望让 VLM 学会判断任务状态,并把这种能力进一步扩展到长程规划。团队构建了包含 4600 万条样本的 EgoTSR-Data,并设计了三阶段课程学习流程。