NVIDIA 发布 LocateAnything-3B
小而快、专门负责看图找位置”的 NVIDIA 视觉语言模型,适合 Agent/机器人场景:对屏幕操作、具身智能、视觉导航这类任务很有用 主要特性:
- 3B 参数量:模型体量相对小,更适合高效部署。
- 统一视觉定位框架:包括目标检测、指代表达定位、文档布局理解、GUI/屏幕元素定位等。
- 高精度定位:强调高 IoU 场景下的定位质量,适合需要框得准的任务。
- 高吞吐推理:采用并行 box decoding,提升解码速度。 点评:做本地视觉识别或者机器人的项目可以试试
6.3 Google Gemma 4 12B发布
Gemma 4 12B 是一个面向本地部署的中型统一多模态模型,特点是“能看、能听、能写、上下文长、硬件门槛相对低”。 主要特性:
- 12B 参数规模:属于中等尺寸模型,比小模型更强,同时比更大模型更容易本地部署。
- 统一多模态:原生支持文本、图片、音频输入,不需要单独的视觉或音频编码器。
- 本地友好:官方定位是可在 16GB 级别设备上运行,适合笔记本和本地推理。
- 长上下文:支持 256K 上下文,适合长文档、代码和多轮 Agent 场景。
- 低延迟优化:引入多 token 预测等机制,目标是提升生成速度。
- 适合 Agent/代码任务:适合做推理、编程、多模态助手和本地工作流。 点评:小钢炮,低配置电脑可以试试看
6.1 Minimax-m3发布
面向编码和智能体任务的国产开源前沿模型,主打 1M 超长上下文和原生多模态能力 主要特性:
- 1M上下文窗口
- 原生多模态能力
- 多Agent能力
- 编程与工程能力
| 模型 | 输入价格(每百万 tokens) | 输出价格(每百万 tokens) | 缓存读取(每百万 tokens) |
|---|---|---|---|
| MiniMax-M3(上下文 ≤ 512K,7天限时五折) | ¥4.2 / ¥2.1 | ¥16.8 / ¥8.4 | ¥0.84 / ¥0.42 |
| MiniMax-M3(上下文 512K ~ 1M) | ¥8.4 | ¥33.6 | ¥1.68 |
| 点评:目前实际评测效果两级分化,夯拉不一,可以再观察下 |