
Inception Labs 开发的 Mercury 是全球首个商业级扩散大语言模型(dLLM),其最新发布的 Mercury 2.5 实现了超高生成速度与强劲的推理能力,目前Mercury 2.5 API、 Puter.js和网页版可以免费使用。
什么是扩散大语言模型(dLLM)?
- 并行生成:传统大模型一个字接一个字地往后生成词语(自回归);而扩散模型可以同时生成许多个词。
- 极致速度:这种并行结构让它的运行速度比普通模型快得多,且延迟极低。
Mercury 2.5 核心性能
- 超快速度:在常见的 NVIDIA GPU 上,速度可达每秒 1,107 个 Token。
- 智能提升:相比 Mercury 2 智能水平提升了 40%,表现接近轻量级前沿模型。
- 长上下文:支持 260K 的上下文窗口。
- 经济划算:标准定价为每百万输入 Token 0.20 美元、输出 0.75 美元。
- 高级功能:支持可调节的推理、并行工具调用和结构化 JSON 输出。
主要应用场景
- 语音助手:生成首字延迟(TTFT)低于 170 毫秒,适合实时语音对话。
- 搜索与 RAG:在单次交互中处理密集的搜索请求、重排和摘要。
- 代码编写:满足极度敏感的低延迟编程和代码编辑工作流。
官网地址:https://www.inceptionlabs.ai/