本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。
模型 & 产品
Nano Banana 2 Lite
Google DeepMind 于 2026 年 6 月底发布的轻量化高速图像生成模型,技术名 gemini-3.1-flash-lite-image,属于 Nano Banana 家族的入门线,主打生成速度与调用成本,核心对标字节 Seedream 5.1 Lite,面向高吞吐批量生图与快速创意迭代。
- 性能:1K 文生图平均约 4 秒,是 Google 旗下最快的图像模型;单张 1K 定价低至 0.034 美元,性价比处于第一梯队。虽为轻量版,仍保留了提示词遵循度、角色/物体一致性与图内文字渲染能力,达到主流生产可用水平。
- 生态:可与同期的 Gemini Omni Flash 视频模型联动,形成「批量出图 → 一键转短视频」的链路;官方建议初代 Nano Banana(
gemini-2.5-flash-image)用户迁移至此版本。 - 接入:已上线 Google AI Studio、Gemini API 与企业智能体平台,并集成进谷歌搜索 AI 模式、Gemini App、谷歌相册等消费产品。
Gemini Omni Flash
Gemini Omni 全模态创作家族的首款落地产品,轻量高效的多模态视频生成与编辑模型。2026 年 5 月 Google I/O 首次亮相,7 月开放公开预览,定位是把 Gemini 的通用推理能力与视频生成融合,做「对话式、可迭代」的高速视频创作。
- 能力:原生多模态输入,单次推理即可同步生成画面与音效/旁白/背景音乐,自带物理世界理解;支持多轮自然语言迭代编辑(连续调整灯光、镜头、风格、动作,保持角色与场景一致);可直接调用 Gemini 世界知识构建内容,适配科普、历史、产品讲解类视频。
- 评测:官方视频编辑 Elo 中两项核心指标居首——整体偏好 1087、指令遵循 1082,领先 HappyHorse、可灵 v3 Pro、Seedance 2.0。
- 定价与联动:0.1 美元/秒(与 Veo 3.1 Fast 持平),10 秒 1080P 约 0.9 美元、4K 约 1.5 美元;与 Nano Banana 2 Lite 打通形成「秒级生图 → 转视频 → 多轮编辑」链路,支持最多连续三次迭代。
- 局限:单段最长 10 秒;暂不支持自定义音频参考与画面外场景扩展;API 端输入素材最长 3 秒。
LongCat 2.0
2026 年 6 月 30 日开源的大规模 MoE 语言模型,总参数 1.6T、单 token 激活约 48B,预训练数据超 35 万亿 token。最大看点是全链路基于非英伟达 AI ASIC 超算集群完成训练与部署,首次完整验证了前沿大模型在替代硬件平台上规模化稳定训练的可行性;同时深度适配 Claude Code、OpenClaw、Hermes 等 Agent 与代码工具链。
- 两大架构创新:
- LongCat 稀疏注意力(LSA)——在 DeepSeek 稀疏注意力基础上解决索引器瓶颈,通过流式感知索引(顺序读取合并 HBM 访问)、跨层索引(一次索引服务连续多层)、分层索引(块级粗召回+候选细选,免训练启用)三项正交设计,提升长上下文速度且不掉点。
- N-gram Embedding——用 5 元组把嵌入空间扩大约 100 倍(1350 亿 N-gram 参数),在约 97% MoE 稀疏度下,扩容 N-gram 的收益高于单纯加专家;参数占比严格控制在 10% 以内。
- ASIC 训练体系:6D 并行(标准 TP/CP/EP/DP/PP 外新增 EMBP 处理 N-gram 嵌入)、Superpod 组网(单 pod 48 机全互联、RoCE 外联,吞吐提升约 30%)、ZeRO-1/选择性重计算/Muon 优化器、全链路算子确定性与硬件位翻转检测、基于 all-gather 的 CP 并行支撑 1M 上下文训练。
- 推理部署:absorb 注意力 + KV 缓存并行 + ScMoE 稠密/稀疏分支完全并行;Super Kernel 消除内核启动开销、大 L2 缓存预取权重;Prefill-Decode 分离部署,Decode 侧 128 路大专家并行 + 异步 EPLB。
- 后训练:Agent / 推理 / 交互三类专家分别强化,再以多教师在路蒸馏(MOPD)融合。评测在代码 Agent、通用 Agent、基础能力三类基准整体处于全球第一梯队。
论文精选
每篇附 arxiv/项目链接,并给出原始的「实用性 / 创新性」评分(满分 5)。
LLM / Agent
ATMem — What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States
- https://arxiv.org/pdf/2606.31612 | 实用性 3 / 创新性 3
- 阿里通义实验室主导,联合悉尼科技大学、阿德莱德大学(Steven Hoi 参与)。
核心动机:移动端 GUI Agent 处理跨页面、跨应用的长任务时,现有记忆方案本质都是「被动存档」——只记「看到/做过什么」,不标注每条数据在任务中的执行状态,Agent 每步都要从零散历史里推断进度,轨迹越长越容易重复、遗漏、忽略约束。而 AndroidWorld 中 83% 任务涉及数据操作,进度完全由数据状态驱动。团队主张:记忆应是主动维护的任务执行状态表,像人的工作记忆一样实时跟踪进度。
横向对比:AndroidWorld 上 8B 的 ATMem-UI 成功率 76.6%,比同尺寸 MAI-UI 高 5.9 分,比 230B 的 UI-TARS-2 还高 3.3 分;零样本 MobileWorld 上 4B 版本即超过所有 7B/72B 基线。
优点:抓住了长程 GUI 任务「记不住执行状态」而非「记不住信息」的核心矛盾;分层结构(工作流层管阶段/约束、数据条目层管状态)通用清晰;STR-GRPO 干预式 RL 用「开/关记忆」成对对比精确估计记忆边际收益并惩罚冗余调用;配套 DataScope 基准与「应用级进度/范围感知 F1」新指标。 缺点:收益集中在数据操作类任务,纯交互/创意类提升有限;整体结构仍有人工预设成分;强依赖环境验证器准确性;未与检索增强、多模态长期记忆等更复杂方案充分对比;仅在安卓验证,桌面/Web/机器人场景未知。
图像
SimpleSearch-VL — A Simple Recipe for Multimodal Agentic Deep Search
- https://arxiv.org/pdf/2606.31504 | 代码 | 实用性 3 / 创新性 2
- 东南大学 + 蚂蚁集团,底座 Qwen3-VL。
核心动机:多模态深度搜索 Agent 普遍存在三个痛点——工具调用轨迹长尾延迟拖慢 RL 训练、以图搜图「视觉相似但实际不匹配」导致误用证据、固定流水线+专门摘要模型依赖过重。思路是不堆数据/工具/辅助模型,而是优化 Agent 自身的「搜索-验证」流程。
优点:提出分解式自适应 Rollout(FAR),给难样本多分配采样、给已有信号样本跳过冗余长尾,缓解长尾延迟;显式证据验证推理(以图搜图返回缩略图先比对再使用);网页摘要由 Agent 自身完成、工具接口解耦,部署轻量;数据效率极强——仅 5K SFT + 2K RL、单节点约 1 天,8B 相对基线提升 15.8 分、30B 提升 16 分并对标 Gemini-3-Pro Agent。 缺点:工具仅文本搜索/区域以图搜图/网页访问三类,深度研究任务覆盖不足;评测全是事实类 VQA;奖励只管格式和答案正确,未约束搜索步数/证据质量;仅在 Qwen3-VL 上验证通用性。
DataEvolver — Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
- https://arxiv.org/pdf/2606.31537 | 代码 | 实用性 3 / 创新性 2
- 中南大学 + 香港科技大学。
核心动机:文字渲染类图像生成的瓶颈在数据质量,而传统「爬取-过滤-冻结」静态流水线浪费了失败样本蕴含的信息(哪些关键词易出坏图、哪些场景覆盖不足),且过滤规则固定无法迭代。DataEvolver 把数据构建变成「反馈驱动的自进化闭环」:Retriever 检索、Verifier 质检并标注失败原因、Critic 把失败统计成语义反馈优化下一轮策略、Generator 定向生成长尾样本补缺。
横向对比:同为 75 万数据量,PixArt-α 上 OCR-F1 比最强基线 MARIO 提升 85.3%(TextScenesHQ)与 35.3%(LongTextBench);换 Show-o2 也一致提升,说明收益来自数据本身。 优点:把丢弃的失败样本「变废为宝」为改进策略的反馈;多 Agent 分工清晰、闭环自动化;效果跨生成器可迁移;数据多样性与长尾覆盖更好。 缺点:强依赖 Verifier 准确性;仅验证了文本丰富图像一个场景;最大规模 75 万、缩放规律未充分验证;相比静态管道工程复杂度更高。
NormGuard — Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning
- https://arxiv.org/pdf/2606.27771 | 实用性 2 / 创新性 3
- 香港科技大学 + 快手 + 国科大(通讯 Wenhan Luo)。
核心动机:流匹配模型 RL 后训练存在「奖励过优化」——奖励涨了画质反而过锐、色偏、光影失真。团队首次观测到 RL 微调后每步去噪速度幅度均匀膨胀 5%~15%(类比 CFG 的膨胀现象),但 CFG 那套「推理时缩回幅度」在 RL 场景无效(膨胀已练进权重);同时数学分析证明批次层面压制幅度几乎不损失奖励。既然推理时修没用、训练时压又不亏奖励,就在训练阶段加约束。
优点:本质是单边铰链惩罚(仅 1 个超参 λ),可与所有「速度局部」型 RL 方法(NFT/AWM/DPO)叠加、改动极小;在 SD3.5、FLUX.2 两基座、三种 RL 算法、两种奖励模型上一致提升画质且几乎保留奖励;少步推理(4/10 步)增益更强;与 KL 正则互补;已排除「等效早停」的混淆。 缺点:不兼容 Flow-GRPO 这类轨迹级梯度方法;只观测到膨胀现象、未解释成因;奖励无损是批次层面结论、单样本仍受影响;偏经验性、无最优性保证、λ 需调。
DisciplineGen-1M — A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing
- https://arxiv.org/pdf/2607.02290 | 项目 | 实用性 3 / 创新性 2
- 上海交大主导,联合华南理工、厦大、中科大(杨雪团队),与团队此前的 GenExam/GRADE 评测基准形成闭环。
核心动机:图像模型生成知识密集型学术图表(数学公式、化学分子、电路、乐谱等)时可靠性差——符号/连线/结构一处出错整图就失去价值,根因是缺少带显式知识约束、且文生图与编辑配对的专用训练数据。DisciplineGen-1M 打造百万规模、覆盖 10 个学科、同时支持文生图与图像编辑的学术视觉数据集。
横向对比:相比 TextAtlas5M(仅富文本、无学科属性)、StructVisuals(仅商业图表),是首个百万级、跨多学科、双任务且自带结构化知识监督的数据集。对 Qwen 系列 LoRA 微调后:GenExam 开源第一(51.4,+15.6)、GRADE 开源第一(58.7,+28.7),并在 WISE/RISE 通用推理生成上稳定提升。 优点:填补多学科视觉生成训练数据空白;矢量渲染/OCR 编辑/程序化合成/数据过滤四条互补流水线可扩展;文生图+编辑任务形态完整;泛化增益明确。 缺点:数学(33.3%)+化学(26.6%)占近 60%、长尾学科偏少;以矢量线条示意图为主、写实学术插图少;地图/乐谱仍弱于 FLUX.2 dev;仅做了 LoRA 验证。
视频与世界模型
WorldDirector — Building Controllable World Simulators with Persistent Dynamic Memory
- https://arxiv.org/pdf/2607.02517 | 项目 | 实用性 2 / 创新性 2
- 香港科技大学主导(通讯陈启峰),联合蚂蚁、浙大、港中文,底座为蚂蚁开源的 LingBot-World-Base。
核心动机:视频世界模型普遍「物体出镜头就失忆」——动态物体移出画面后停止运动或重现时形态/位置出错,根因是模型把「运动逻辑」和「像素渲染」混在一起学。现有外挂监视器方案(LiveWorld,多物体算力爆炸)与隐式记忆方案(HyDRA,长时离镜身份崩坏)都有缺陷。WorldDirector 首次提出「运动编排与视觉生成解耦」——LLM 当总导演统筹 3D 运动,生成模型专心渲染。
优点:解耦思路清晰,物体离镜再回来不变脸、不瞬移,长时一致性强;可精确指定每个物体的出现时机/路径/相机走位甚至凭空加物体,适合交互与游戏编排;位置条件+外观锚定+上下文记忆三机制配合,因果分块生成支持无限长。 缺点:主要用游戏合成数据训练,真实感/复杂自然动作一般;运动规划上限受限于 LLM;大角度转身时外观仍可能漂移;仅验证平移类简单运动,离完整物理模拟器尚远。
PhysisForcing — Physics Reinforced World Simulator for Robotic Manipulation
- https://arxiv.org/pdf/2606.28128 | 项目 | 实用性 3 / 创新性 3
- 北京大学 + NVIDIA(通讯周大全,刘明宇参与),配套自研 R-Bench 评测。
核心动机:视频生成模型作机器人「世界模拟器」时常违反物理常识(机械臂跳变、物体变形、抓住的物体飘走)。作者发现两个规律:物理合理性分层(像素层要轨迹连续、语义层要交互关系正确),且物理错误高度集中在机械臂/被操作物/接触区等前景。此前方法要么全图均匀监督(背景稀释信号)、要么单层约束,效率低。方案是分层 + 区域聚焦的训练时物理对齐,复用 CoTracker3/V-JEPA/Depth Anything 但只监督交互关键区。
优点:只在关键区施加像素+语义双层监督,精准高效;适配 Wan 5B/14B、Cosmos3-Nano 等不同底座、多基准稳定涨点;辅助模块仅训练时用、推理零成本;直接提升下游——世界模型规划成功率 16%→24%、下游策略平均 +4.6%;零样本组合泛化有效。 缺点:微调方案,无法突破底座能力天花板;监督全来自 2D 视觉、非严格 3D 物理,极端场景仍可能出错;依赖高质量机器人视频数据;语义对齐偏经验性、可解释性较弱。
Translation as a Bridging Action — Transferring Manipulation Skills from Humans to Robots
- https://arxiv.org/pdf/2606.28133 | 项目 | 实用性 3 / 创新性 3
- 香港大学 MMLab + 字节 Seed,基于 π0 风格流匹配 VLA,团队此前有 GR-3、ByteMini 平台。
核心动机:想用低成本海量人类操作视频教机器人,但直接搬 6DoF 腕部动作行不通——人手姿态旋转分量噪声大、人手与平行夹爪接触模式不同。核心观察是腕部平移是人和机器人共通、低噪声、语义明确的动作维度,而旋转迁移价值低。于是只保留平移作「桥梁动作」,先用人类数据学「往哪动、做什么」,再用少量机器人数据映射成完整 6DoF。
优点:抓住「平移可靠、旋转不可靠」的核心矛盾,直觉性强易落地;交错动作 token + 注意力掩码天然适配不同数据源(缺什么组件遮掉什么),训练逻辑统一;效果随人类数据量增长、并加速少样本机器人微调;验证扎实(含性能上限分析)。 缺点:放弃旋转,需精细手腕旋转的任务(拧、插、勾)表现差;依赖第一视角坐标系、对视角变化敏感;仍需少量机器人数据、无法零样本跨到新机器人;仅在双臂平行夹爪验证。
SATB-VR — Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending
- https://arxiv.org/pdf/2606.28677 | 代码 | 实用性 2 / 创新性 2
- 阿里 + 哈工大 + 西安交大,底座 CogVideoX1.5-5B,团队此前有 Vivid-VR。
核心动机:视频修复扩散模型两极分化——50 步多步模型效果好但极慢,单步蒸馏快但细节平滑、时序闪烁。关键观察是修复不需从零生成,早期低 SNR 步骤冗余,可从中高 SNR 起步。但推理时去噪器从预测器的不完美估计起步、训练时只见真实加噪输入,分布不一致,强行联合训练会产生伪影。SATB 用 SNR 感知的轨迹混合解决这个不一致,实现 5 步以内达到甚至超越 50 步质量。
优点:SATB 从扩散后验公式推导、用相对 SNR 控制混合权重,从根源消除训练-推理不一致;DDC 损失用同步更新的去噪器反向监督预测器中间特征、互相促进;5 步感知质量超 50 步传统方案、时序一致性远好于单步;支持 1~10 步灵活切换;基于 LoRA、训练成本可控。 缺点:仍慢于单步蒸馏、达不到实时;5B DiT 底座部署门槛高;PSNR/SSIM 等全参考指标不占优(生成式修复共性);高分辨率下延迟仍高。
DreamForge-World 0.1 Preview
- https://arxiv.org/pdf/2606.30292 | 项目 | 实用性 3 / 创新性 2
- 哈萨克斯坦 DreamForge AI 实验室,仅两人自资助研发,全部基于开源模型(视频主干 LongLive 1 / Wan2.1-T2V-1.3B,动作控制移植 Matrix-Game 2.0),仅用 64 小时游戏视频数据适配训练。
核心动机:主流世界模型都在往「大参数、大数据、持久空间记忆」的重方向卷,算力门槛极高、消费级显卡跑不动。该工作验证一条互补路径:基于开源视频底座只做少量定向适配,就能在单张消费级 GPU 上实时可交互,不拼画质/记忆/物理,优先覆盖交互能力广度。
优点:成本极低——64 小时数据、小团队即可,单张 RTX 4090 fp8 下 14-15 FPS、显存仅 4-5GB;交互功能全面(文本/图像/视频/混合初始化、键鼠实时控制、第一/第三人称、中途重写提示、分钟级连续交互);做了 KV 缓存量化、异步流式解码、轻量 VAE 等工程优化,是可运行的预览系统;技术路线对小团队有可复现参考价值。 缺点:无持久空间记忆(镜头转回场景会重生成,最核心短板);长时生成漂移;控制精度有限、第三人称稳定性弱;仅 480p、无音效/多智能体/可靠物理;暂未开源权重。
Orca — The World is in Your Mind
- https://arxiv.org/pdf/2606.30534 | 项目 | 实用性 3 / 创新性 3
- 北京智源(BAAI)Orca 团队(王仲远、王鹏伟),底座 Qwen3.5-VL,此前有 RoboBrain 等积累。
核心动机:通用智能的核心不是「会做单个任务」,而是像人一样先在脑中构建世界状态,再输出不同模态结果。此前语言/视频/具身模型各做下一词/下一帧/下一动作预测,表征体系割裂。Orca 提出统一的「下一状态预测」范式——用无意识学习从视频学稠密自然的物理状态转移、用有意识学习从语言标注学稀疏的事件级转移,共同学一个统一世界隐空间,冻结主干后仅用轻量解码器读出文本/图像/动作。核心验证目标:世界隐空间建模越强,下游所有任务越强。
优点:范式有开创性,把分散的 token/frame/action 预测统一到「状态预测」;参数/数据增加时损失持续下降、三类下游任务同步提升,可扩展性获验证;预训练不用动作标注仅靠视频,就能迁移到机器人动作、对标 π0.5 且自恢复更强;冻结主干下三方向均超同尺寸专用基线;FlagScale 工程优化使吞吐比 StarVLA 提升 4.4 倍。 缺点:仅接入视觉+语言、无音频/触觉/力觉;视觉状态监督对齐到冻结视觉编码器特征、非原生统一状态;仅验证 0.8B/4B 小尺寸、12.5 万小时视频只用了 1/10;状态转移偏分钟级短程;自建评测基准规模有限。
WorldRoamBench — An Open-World Benchmark for Long-Horizon Stability of Interactive World Models
- https://arxiv.org/pdf/2606.31672 | 项目 | 实用性 2 / 创新性 2
- 阿里高德 AMAP CV 实验室主导,联合南大、清华、北大。属评测基准工作。
核心动机:现有交互世界模型评测有四个盲区——时长太短(多测 5-10 秒)、动作评测太粗(只算整体路线、掩盖单帧无响应,且不同模型「按一下走多远」不同、直接比轨迹不公平)、几乎不测物理(碰撞/穿模/光影/3D 一致性)、记忆评测把「动作走偏」和「记不住场景」混为一谈。WorldRoamBench 专测 10-60 秒长程交互下的动作跟随、视觉稳定、物理合理、记忆一致四大能力。
优点:四个维度精准对应真实交互槽点,诊断价值高;评测设计公平(动作只比路线形状、记忆用整段点云对比);600+ 用例覆盖自然/城市/室内、实测 10+ 主流模型,得出「画质与动作能力独立」「物理约束会拉低动作分」等有指导性的结论;全自动化、新模型接入成本低。 缺点:物理靠 VLM、记忆靠深度估计+点云重建,存在误差;以 WASD 漫游为主、缺复杂任务型交互;第三人称覆盖不足;闭源模型走网页模拟按键、测试条件不完全一致。
ABot-M0.5 — Unified Mobility-and-Manipulation World Action Model
- https://arxiv.org/pdf/2607.00678 | 代码 | 实用性 3 / 创新性 2
- 阿里高德 AMAP CV 实验室 ABot 系列最新迭代,自研 ALAM 潜在动作模型,底座 Wan2.2。首款专为移动操作机器人(能走+能抓)优化的世界动作模型(WAM)。
核心动机:现有 WAM 直接用到移动操作场景有三个「对不齐」——时间粒度(世界模型按粗视频块预测、机器人接触瞬间需帧级控制)、动作空间(底盘导航低频大范围 vs 机械臂高频精细,混训梯度互相干扰)、训练推理(训练用真实未来视频、推理只能用自生成视频,误差累积)。方案是做三层对齐从结构上适配,而非堆参数。
优点:加一层「潜在动作」当桥梁,把粗视频预测转帧级运动意图再转控制,兼顾精度与跨形态迁移;双层 MoT 把导航/操作解耦训练、联合推理,减少梯度干扰;Dream Forcing 用自生成「梦境视频」训练动作预测、贴合推理分布、长序列更稳;在 RoboCasa365/RoboTwin/LIBERO 取得 SOTA 并有真机验证。 缺点:三阶段训练 + Dream Forcing 双前向,成本高;主要验证单臂+底盘、双臂/人形未充分验证;仍是视频扩散路线、超长程漫游仍会漂移;潜在动作依赖预训练 ALAM 编码器、全新场景可能失效。