AI 变更周报 · 2026-09-07
本周筛选 20 条已核验变化:论文 16 条,模型/API 0 条,开源 4 条。
本周摘要
本周筛选 20 条已核验变化:论文 16 条,模型/API 0 条,开源 4 条。
RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?
RoboSPA是一个用于评估视觉-语言-动作(VLA)模型在空间推理和长时程程序规划能力的大规模机器人操作数据集和基准。实验表明,当前VLA模型在复杂空间关系、精确低层执行和记忆密集型规划方面仍存在困难。
对你的影响
该基准为VLA模型提供了更细致的诊断指标,揭示了现有模型在复杂场景和长时程任务中的不足,有助于推动更强大、可靠和泛化的具身智能体开发。
huggingface/text-generation-inference · v3.3.7
此版本包含多项更新:在GitHub Actions中暴露操作缓存URL和运行时作为机密;新增max_image_fetch_size功能以限制图片获取大小;两次维护模式调整;修复当NVIDIA_VISIBLE_DEVICES为'all'或'void'时自动计算num_shard/num device的问题。
对你的影响
对开发者:新增配置项max_image_fetch_size可限制图片获取,影响相关功能使用;修复了设备数量自动计算问题,提升在特定环境下的兼容性。对运维:GitHub Actions的机密暴露可能影响CI流程配置。维护模式调整可能影响项目状态。
langchain-ai/langchain · langchain-core==1.6.2
langchain-core 从 1.6.1 升级到 1.6.2,主要变更包括:支持异步工具(feat(openai))、修复 google-genai 和 bedrock 标准内容中的突变问题(fix(core)),以及升级依赖 mistune 和 tornado 以修复安全漏洞。
对你的影响
此版本为补丁更新,包含功能增强(异步工具支持)和关键修复(避免内容突变),以及依赖安全升级。对使用 openai 异步工具的用户有新增功能,对使用 google-genai 或 bedrock 的用户修复了潜在数据一致性问题,依赖升级可能影响兼容性。
vllm-project/vllm · v0.28.0
v0.28.0 版本包含 584 个提交,来自 270 位贡献者(其中 76 位新贡献者)。主要亮点包括:Kimi-K3 性能优化(如 DCP 支持、融合 FlashKDA 内核、SiTU 激活、GEMM-RS、自适应投机令牌预算、共享专家分片)、DeepSeek V4 的稀疏 MLA 端到端支持、投机解码改进(DFlash2、DSpark 置信度调度验证)、Model Runner V2 成熟化(E/P/D 分离、权重卸载、多层级 MTP KV 缓存)、分层 KV 缓存卸载(磁盘卸载、二级管理器)、Rust 前端与 gRPC 支持、新默认值(max_num_batched_tokens 提升至 16384、Mamba 前缀缓存默认启用、Blackwell CUDA 图捕获默认值提升至 1024)。破坏性变更包括 bitsandbytes 迁移至外部插件、Transformers 升级至 5.15.0、移除 calculate_kv_scales 和 override_attention_dtype。新增模型支持包括 Muse Glimmer、Ling 3.0 Flash、Dots3 NOTE、Interns2mobius 等。
对你的影响
此版本对 vLLM 用户有显著影响:性能提升(Kimi-K3 和 DeepSeek V4 优化)、新模型支持、投机解码增强、KV 缓存卸载功能、Rust 前端和 gRPC 支持。破坏性变更要求用户调整:bitsandbytes 需使用外部插件、Transformers 版本升级至 5.15.0、移除已弃用的 API。新默认值可能影响现有配置,建议用户审查并更新部署。
huggingface/transformers · Release v5.16.1
发布 v5.16.1,包含 GLM-5.3-Flash 模型支持及小补丁修复。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,总参数 320B,激活参数 18B,性能优于 GLM-5.2,价格为其十分之一,接近 Claude Opus 4.8 的编码和智能体基准。采用混合架构(稀疏和线性注意力)及 Manifold-Constrained Hyper-Connections,基于 30T-token 多模态预训练语料。修复包括恢复张量并行 API 的 BC 行为,以及固定 ESMFold2 的内核提交和仓库路径。
对你的影响
新增 GLM-5.3-Flash 模型支持,提升多模态能力并降低推理成本;修复张量并行 API 的向后兼容性问题,确保现有代码稳定性;安全修复固定 ESMFold2 内核,增强安全性。