NVIDIA 发布 LocateAnything-3B

小而快、专门负责看图找位置”的 NVIDIA 视觉语言模型,适合 Agent/机器人场景:对屏幕操作、具身智能、视觉导航这类任务很有用 主要特性:

  • 3B 参数量:模型体量相对小,更适合高效部署。
  • 统一视觉定位框架:包括目标检测、指代表达定位、文档布局理解、GUI/屏幕元素定位等。
  • 高精度定位:强调高 IoU 场景下的定位质量,适合需要框得准的任务。
  • 高吞吐推理:采用并行 box decoding,提升解码速度。 点评:做本地视觉识别或者机器人的项目可以试试

6.3 Google Gemma 4 12B发布

Gemma 4 12B 是一个面向本地部署的中型统一多模态模型,特点是“能看、能听、能写、上下文长、硬件门槛相对低”。 主要特性:

  • 12B 参数规模:属于中等尺寸模型,比小模型更强,同时比更大模型更容易本地部署。
  • 统一多模态:原生支持文本、图片、音频输入,不需要单独的视觉或音频编码器。
  • 本地友好:官方定位是可在 16GB 级别设备上运行,适合笔记本和本地推理。
  • 长上下文:支持 256K 上下文,适合长文档、代码和多轮 Agent 场景。
  • 低延迟优化:引入多 token 预测等机制,目标是提升生成速度。
  • 适合 Agent/代码任务:适合做推理、编程、多模态助手和本地工作流。 点评:小钢炮,低配置电脑可以试试看

6.1 Minimax-m3发布

面向编码和智能体任务的国产开源前沿模型,主打 1M 超长上下文和原生多模态能力 主要特性:

  • 1M上下文窗口
  • 原生多模态能力
  • 多Agent能力
  • 编程与工程能力
模型输入价格(每百万 tokens)输出价格(每百万 tokens)缓存读取(每百万 tokens)
MiniMax-M3(上下文 ≤ 512K,7天限时五折)¥4.2 / ¥2.1¥16.8 / ¥8.4¥0.84 / ¥0.42
MiniMax-M3(上下文 512K ~ 1M)¥8.4¥33.6¥1.68
点评:目前实际评测效果两级分化,夯拉不一,可以再观察下