NVIDIA 称 TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic Benchmark,速度提升至 6.4 倍。
MoE 模型可在每个 token 上只激活部分参数,例如 30B 模型每次仅用约 3B 参数,从而在容量与计算成本之间取得不同权衡。
智能体AI正在改变科研流程。通过集成NVIDIA BioNeMo NIM微服务,AI科研助手可以调用蛋白质结构预测模型,辅助研究人员分析数据、提出假设并优化实验方向。
阿里巴巴开放 Qwen3.8-Flash-Next 模型权重,作为下一代 Qwen4 架构的预览。该模型采用多模态 MoE 架构,原生支持 262,144 Token 上下文,并被用于探索智能体编程场景。
NVIDIA Groq 3 LPX 是面向 Vera Rubin 平台的交互式 AI 推理加速器。它可与 Vera Rubin NVL72 配合,进一步强化平台在长上下文场景中的高速交互能力,并覆盖从小型到大型、开放与闭源模型等多类 AI 工作负载。
智能体 AI 工作负载具有高度波动和不可预测性。NVIDIA 认为,除了负责模型计算的 GPU,CPU 在任务编排、工具执行和沙箱计算中同样关键,并以 Vera CPU 面向这类 AI 基础设施需求。
随着 AI 智能体从单轮问答转向推理、工具调用、多智能体协作等多步工作流,推理计算需求持续增长。英伟达称,Vera Rubin 与 Blackwell 平台正面向这一趋势提升单位功耗下的智能体 AI 性能。
NVIDIA 探索如何让通用 AI 编程智能体利用 Holoscan 的示例、文档和开发工具进行应用开发,并结合 HoloHub 参考应用与组件,验证智能体辅助边缘实时 AI 开发的可行性。
大语言模型推动推荐系统从传统的嵌入相似度范式转向生成式建模:根据用户历史行为序列,直接预测下一步动作或目录中的下一个物品,为大规模推荐系统提供新的建模思路。
NVIDIA 介绍 SkillEvaluator,用于衡量技能包能否真正提升 AI Agent 的任务表现。技能通过封装指令、示例和工具使用指南,帮助 Agent 减少无效探索与 Token 消耗,更快完成专业任务。
NVIDIA 推出 Cosmos 3 Edge,一款面向机器人端侧运行的 4B 全模态模型,其中包含基于 Nemotron 的 2B 推理模块,旨在降低世界模型部署到机器人板载计算硬件的难度。
视觉语言模型需要跨机构数据进行适配,但原始数据往往无法集中。联邦学习可让数据保留在本地,同时协调多方训练,为多模态 AI 提供一种兼顾协作与数据本地化的方案。
原子级材料模拟不仅需要科学知识,还依赖高效计算实现和易用的软件接口。NVIDIA ALCHEMI Toolkit 试图降低后两方面的门槛,并探索让 AI 编程智能体参与材料模拟工作流。
阿里巴巴发布 Qwen3.8-2.4T-A95B 开源权重。该 MoE 模型总参数 2.4T、每 token 激活 95B,并支持可配置推理部署。
NVIDIA 推出 Nemotron 3.5 Lightning:一款开放的 30B MoE 模型,面向长时运行 AI 智能体中的高频执行任务,强调降低成本与延迟。
JetPack 7.2.1 面向 Jetson 视频应用新增智能体视频能力与 T3000 仿真,覆盖机器人、智能视频分析、工业自动化等场景。
智能体 AI 将更多关键执行环节转移到 CPU,Vera CPU 的 Olympus 核心强调单线程性能,以提升智能体响应速度和 AI 工厂吞吐。
多摄像头 3D 跟踪可用于在大空间内跨视角追踪同一目标,弥补单摄像头 2D 跟踪在深度信息和跨画面连续性上的不足。
