直接答案:AI21 Labs 当前面向开发者的主线不是旧版 Jurassic,而是 Jamba 模型与 AI21 Maestro 知识任务系统。需要标准聊天补全、长上下文或工具调用,先评估 Jamba Mini;更看重复杂任务质量时再用 Jamba Large。需要连接企业资料、规划检索并核验答案时,评估 Maestro,而不是把它当成另一个聊天模型。仍在调用 Jurassic 的项目,应先建立回归集,再迁移到带日期的 Jamba 端点。
本文依据 AI21 官方文档、API Reference、价格页、变更日志与 Responsible Use Policy,于 2026 年 7 月 19 日复核。模型别名、价格、试用额度和平台可用性会变化;生产接入前应再次查看官方文档总览和账户控制台。本文没有购买套餐,也没有运行模型质量基准,因此不把厂商描述改写成“实测最强”结论。

AI21 Labs、Jamba、Maestro 和 Wordtune 有什么区别?
AI21 Labs 是提供模型与企业 AI 系统的公司;AI21 Studio 是开发者访问 API 和管理用量的入口;Jamba 是基础模型家族;Maestro 是面向企业知识任务的编排与核验系统;Wordtune 则是独立的写作辅助产品。名称混用会直接导致 API、价格、数据连接器和适用场景判断错误。
| 名称 | 它是什么 | 适合解决什么 | 不要误解为 |
|---|---|---|---|
| AI21 Labs | 模型与企业 AI 产品提供方 | 提供 Studio、Jamba、Maestro 等产品 | 一个单独模型 |
| AI21 Studio | 开发者平台与 API 入口 | 创建密钥、调用模型、查看用量 | 模型名称 |
| Jamba | 长上下文基础模型家族 | 聊天补全、摘要、抽取、工具调用、结构化输出 | 旧 Jurassic 的别名 |
| AI21 Maestro | 规划、检索、验证组成的知识任务系统 | 基于文件或企业数据源回答复杂问题 | 只换了名称的 Jamba Chat API |
| Wordtune | 面向终端用户的写作辅助产品 | 改写、润色和总结 | 开发者模型 API |
想先理解基础模型、托管 API 与应用之间的关系,可阅读站内基础模型与生成式 AI 选型指南;如果需求只是写作润色,应单独评估 Wordtune,而不是因为它属于同一家公司就套用 Jamba 的 API 结论。
2026 年应该选哪个 AI21 产品?
| 任务 | 起始方案 | 为什么 | 上线前验证 |
|---|---|---|---|
| 低成本聊天、分类、抽取 | Jamba Mini | 单价低,支持 256K 上下文和标准 Chat Completions | 中文效果、JSON 合法率、P95 时延 |
| 复杂生成与高质量候选 | Jamba Large | 容量更大,但输入输出单价明显更高 | 相对 Mini 的质量增益是否覆盖成本 |
| 企业资料问答 | Maestro | 把规划、检索、引用和验证放入任务流程 | 连接器权限、引用忠实度、无法回答策略 |
| 大量离线任务 | Batch API | JSONL 异步提交,适合非实时批处理 | 企业权限、任务幂等、结果回收 |
| 旧 Jurassic 项目 | 迁移到带日期的 Jamba 端点 | 避免继续依赖旧模型和行为 | 提示词、停止条件、输出格式、质量回归 |
官方 Jamba 模型页列出的当前主力模型如下。参数规模是厂商公开信息,不代表本网站独立核验的效果排名。
| 模型 | 公开规模 | 上下文 | 当前端点/版本 | 适合起点 |
|---|---|---|---|---|
| Jamba Large | 398B 参数、94B 激活 | 256K | jamba-large → jamba-large-1.7-2025-07 |
复杂生成和高质量候选 |
| Jamba Mini | 52B 参数、12B 激活 | 256K | jamba-mini → jamba-mini-2-2026-01 |
成本敏感的生产任务 |
| Jamba 3B | 3B 参数 | 256K | 当前文档未列 Studio API 端点 | 研究具体开放权重/部署条件 |
官方当前明确列出的支持语言为英语、西班牙语、法语、葡萄牙语、意大利语、荷兰语、德语、阿拉伯语和希伯来语,没有把中文列入正式支持清单。中文团队不能仅凭模型能返回中文就认定达到生产要求,应使用真实中文查询、行业术语、长文档和安全样本单独验收。需要对比其他开放权重与 API 路线时,可参考GLM 模型、开放权重与 API 指南和Mistral 模型选型指南。
Jamba API 怎么调用?
AI21 当前使用 /studio/v1/chat/completions。先在服务端设置 AI21_API_KEY,不要把真实密钥写入前端、仓库、文章或日志。下面是按官方 Chat API Reference整理的最小调用;示例仅展示接口形态,没有在本站服务器实际执行。
curl -sS https://api.ai21.com/studio/v1/chat/completions \
-H "Authorization: Bearer $AI21_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "jamba-mini",
"messages": [
{"role": "system", "content": "只依据给定资料回答;证据不足时明确说不知道。"},
{"role": "user", "content": "把以下服务条款提取为责任、期限和例外三栏。"}
],
"temperature": 0.2,
"max_tokens": 800
}'
Python 可使用官方AI21 SDK。生产代码要固定依赖版本,捕获超时、429 与 5xx,并记录请求 ID、模型快照、token 用量和应用侧任务 ID;不要记录完整敏感提示词。
import os
from ai21 import AI21Client
from ai21.models.chat import ChatMessage
client = AI21Client(api_key=os.environ["AI21_API_KEY"])
response = client.chat.completions.create(
model="jamba-mini-2-2026-01",
messages=[ChatMessage(role="user", content="用 JSON 返回三条风险及证据。")],
temperature=0.1,
max_tokens=800,
response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
| 接入项 | 生产要求 | 常见错误 |
|---|---|---|
| 模型名 | 试验可用别名,生产可固定带日期快照并规划升级 | 别名漂移后质量变化却没有回归 |
| 密钥 | 服务端密钥管理、按环境隔离、定期轮换 | 把密钥打包到浏览器或提交到 Git |
| 超时 | 分别设置连接与总超时,取消失去业务价值的请求 | 无限等待导致工作线程耗尽 |
| 重试 | 仅对可重试错误做有限指数退避与随机抖动 | 对 400 也重试,或 429 后并发重放 |
| 输出 | 做 JSON Schema、长度、引用和业务规则验证 | HTTP 200 就直接发布或执行 |

Jamba 的价格和免费额度怎么算?
截至复核日,AI21 官方价格页显示 Jamba Mini 每 100 万输入 token 为 0.2 美元、输出为 0.4 美元;Jamba Large 输入为 2 美元、输出为 8 美元。实际费用以账单、地区、合同和调用渠道为准。
| 模型 | 输入/100万 token | 输出/100万 token | 示例:100万输入+20万输出 |
|---|---|---|---|
| Jamba Mini | $0.20 | $0.40 | 约 $0.28 |
| Jamba Large | $2.00 | $8.00 | 约 $3.60 |
示例只是按公开单价做的算术,不含重试、缓存、检索、存储、人工审核、第三方云平台和税费。官方Usage & Cost 文档说明响应中的 usage 字段可提供 token 计数,可用下面公式估算:请求成本 = 输入 token ÷ 1,000,000 × 输入单价 + 输出 token ÷ 1,000,000 × 输出单价。
| 容易漏算的成本 | 怎样记录 | 控制方式 |
|---|---|---|
| 失败与重试 | 按任务记录尝试次数、状态码和 token | 幂等键、退避、重试上限 |
| 长上下文 | 区分原文、检索片段、历史消息 | 切块、检索、摘要和上下文预算 |
| 人工复核 | 记录每类任务平均审核分钟 | 风险分层,不把高风险内容全自动化 |
| 返工 | 统计首轮通过率和严重错误率 | 改提示词、验证器或淘汰不适合的模型 |
| 第三方平台 | 单独核对云平台账单和限流 | 不要直接套用 AI21 Studio 单价 |
限流、流式输出、工具调用和 JSON 模式有哪些边界?
官方限流页当前列出 Jamba Large 与 Jamba Mini 均为 10 RPS、200 RPM;经由第三方云平台调用时,限制由对应平台单独决定。限流不是并发目标,应用还要受平均输出长度、P95 时延、连接池和下游审核能力约束。
| 能力 | 当前边界 | 工程处理 |
|---|---|---|
| 输出长度 | max_tokens 最高 4096 |
预留结束空间,超长任务拆分并校验完整性 |
| JSON 模式 | response_format 可请求 JSON object |
仍要解析并按 Schema 验证,失败不得执行 |
| Streaming | 通过 SSE 分段返回 | 处理断线、半截输出、取消与最终完成标志 |
| 工具调用 | 与流式调用存在组合约束 | 以当前 API Reference 为准;工具执行前做参数白名单 |
| 并发 | Studio 文档当前 10 RPS / 200 RPM | 客户端队列、令牌桶、指数退避和随机抖动 |
429 的正确做法不是立刻并发重试,而是读取响应信息、降低发送速率并加入抖动。任务需要异步排队、状态轮询和失败恢复时,可沿用站内异步 API 上线验收方法;需要在多个模型供应商间做容量回退时,可参考模型 API、动态限流与部署选型。
什么时候用 Maestro、RAG 或 Batch API?
Maestro 官方说明把它描述为面向知识任务的高级系统:能够规划步骤、检索资料并验证结果,底层可能使用 Jamba 或第三方模型。它不是“自动保证真实”的黑盒;连接器权限、检索范围、引用完整性、拒答策略与人工责任仍需由部署方验收。
| 方案 | 适合场景 | 主要优势 | 主要风险 |
|---|---|---|---|
| 直接 Jamba | 提示词已包含足够上下文的生成、分类、抽取 | 链路短、控制直接 | 没有外部证据时可能编造 |
| 自建 RAG + Jamba | 需自定义检索、权限、排序和观测 | 可控制每个环节 | 切块、权限泄漏、错误召回和引用错配 |
| Maestro | 企业资料上的复杂知识任务 | 规划、检索、验证集成 | 需核对连接器、合同、可观测性和失败边界 |
| Batch API | 大量非实时 JSONL 作业 | 异步处理,便于批量任务 | 当前文档要求企业可用性,需联系销售 |
File Library 文档当前给出最多 50 个文件、单文件 100MB、总计 1GB;数据连接器文档列出 S3、Box、Confluence、Dropbox、Google Drive、Intercom、OneDrive、Teams、Notion、ServiceNow、SharePoint、Zendesk 等企业连接器,并说明 Browse Website 对所有用户开放。这些是产品上限和可用入口,不等于所有连接器在你的套餐、地区和合同中自动可用。
官方提示工程指南明确提醒模型可能捏造引用,可靠的来源落地需要 RAG。验收时至少测:答案中的每个关键主张能否定位到片段、片段是否真的支持主张、有没有遗漏重要例外、无证据时是否拒答、用户是否越权看到其他资料。
Jurassic 项目怎样迁移到 Jamba?
迁移不是把模型名替换掉就结束。旧 Jurassic 代码可能使用不同端点、提示格式、停止词、采样参数和返回结构;Jamba 采用消息数组和 Chat Completions 语义。先冻结旧系统的一组真实输入与人工期望,再逐项迁移。

| 阶段 | 动作 | 通过证据 | 回滚条件 |
|---|---|---|---|
| 盘点 | 列出模型、端点、提示词、停止词、输出解析和调用量 | 完整依赖清单 | 存在未知调用方 |
| 回归集 | 从真实流量抽取正常、边界和高风险样本并脱敏 | 人工期望与严重错误定义 | 样本不能代表生产 |
| 适配 | 改为 messages、明确 system 指令、限制输出并验证 JSON | 单元测试和契约测试 | 解析或业务规则不兼容 |
| 对照 | 同一输入比较质量、时延、token、成本与拒答 | 任务级结果而非主观“更聪明” | 严重错误上升或成本失控 |
| 灰度 | 小比例真实流量、监控错误与用户反馈 | 可观测指标和一键回退 | 关键 SLO 或安全门禁失败 |
别名会更新到新的默认快照,生产系统若需要可重复性,应固定带日期版本,并订阅官方 Changelog,安排升级窗口。固定快照也不是永久支持承诺,仍需建立退役监控和替代方案。
生产上线要满足哪些合规和安全门禁?
AI21 Responsible Use Policy包含几条容易被忽略的硬边界:未经人工介入,不应把生成内容自动发布给超过 100 人的受众;首位阅读者不应被误导为 AI 文本由人类撰写;面向每月超过 100 名用户的产品,应提供有害内容报告机制。涉及受保护属性的自动化决定和政策禁止类别还需单独核查。
| 门禁 | 最低通过标准 | 保留证据 |
|---|---|---|
| 身份与透明度 | 向用户说明 AI 参与,不伪装成人工作者 | 界面文案、版本与发布时间 |
| 公开发布 | 超过政策阈值的受众前有人类介入 | 审批人、审批时间和内容版本 |
| 有害内容反馈 | 达到月活阈值时提供可用的举报入口 | 工单、响应流程和处置记录 |
| 事实与引用 | 关键主张逐条对应来源,无法支持时拒答 | 检索片段、来源 URL、模型和提示版本 |
| 权限 | 工具与数据源最小权限,高风险动作需审批 | 权限清单、审计日志、撤销与回滚演练 |
| 隐私 | 敏感数据最小化,按合同确认存储与处理边界 | 数据流图、保留周期和供应商条款 |
如果模型可以发消息、修改数据、付款或公开发布,风险已经从“回答错误”升级为“执行错误”。应结合站内AI 安全威胁与权限防护指南和AI 智能体治理与上线检查设置最小权限、人工审批、预算上限、操作预览、撤销与回滚。
常见故障怎么排查?
| 现象 | 优先检查 | 处理 |
|---|---|---|
| 401 / 403 | 密钥、Authorization 格式、账户权限和余额 | 服务端轮换密钥,不在聊天或截图中暴露 |
| 404 / 模型不可用 | 是否仍用 Jurassic 或已退役快照,模型名是否拼错 | 查看模型页和 Changelog 后迁移 |
| 429 | 瞬时 RPS、每分钟请求、并发重试 | 队列、退避、抖动、降低并发 |
| JSON 解析失败 | 是否只请求 JSON mode 却没有 Schema 验证 | 重试前先分类错误,必要时修复提示和验证器 |
| 长文遗漏 | 上下文是否超预算、检索是否漏召回、输出是否截断 | 分段、结构化抽取、覆盖率检查 |
| 引用不存在 | 是否让模型凭记忆生成来源 | 用检索结果约束,逐条验证 URL 和证据 |
| 成本异常 | 长历史、重复上下文、失败重试和无界输出 | token 预算、缓存、幂等、任务级账单 |
FAQ
AI21 Labs 现在还主推 Jurassic 吗?
不是。当前开发者文档的主线是 Jamba 与 Maestro,Jurassic 更适合作为历史迁移关键词处理。仍在运行的旧项目应查看当前账户和变更日志,建立回归集后迁移,而不是继续依据旧教程新建集成。
Jamba Mini 和 Jamba Large 应该选哪个?
先用 Mini 跑真实任务基线;只有当 Large 在重要错误率、人工返工或任务完成率上的改进足以覆盖更高成本与时延时再升级。没有自己的回归集,就不存在对所有业务都成立的“最佳模型”。
Jamba 支持中文吗?
模型可能生成中文,但官方当前支持语言清单没有列出中文,因此不能把“能够输出”写成“官方支持”或“生产可用”。中文业务必须单独测试术语、事实、长上下文、格式与安全样本,并保留人工回退。
Maestro 能保证答案没有幻觉吗?
不能。规划、检索和验证能改善知识任务流程,但仍可能发生漏检索、错误引用、证据不足或权限配置错误。必须逐条核验主张与证据,设置拒答、人工升级和审计记录。
AI21 API 可以直接自动发布文章吗?
技术上可以接入发布流程,但 Responsible Use Policy 对面向超过 100 人的自动公开发布提出人工介入要求,而且任何事实、版权、隐私和业务责任仍由部署方承担。正确流程是生成候选、来源核验、编辑审批,再发布。
AI21 的 10 美元免费额度有效多久?
官方页面当前存在冲突:价格页写 7 天,Usage & Cost 文档写 3 个月。应以注册时账户控制台、结算页面和书面条款为准;本文不会选择对用户更有利的数字当作承诺。
编辑复核与纠错记录
本文由兰塞 AI 编辑流程于 2026 年 7 月 19 日复核。新版依据 AI21 官方 Jamba 模型页、API Reference、SDK、价格页、用量文档、限流页、Maestro 与连接器文档、Prompt Engineering、Changelog 和 Responsible Use Policy,重建产品区分、调用方法、成本估算、迁移和上线门禁;删除旧稿的“颠覆、革命、深度理解”等无证据断言,并明确本站没有购买套餐或执行模型质量基准。本站的来源、更新与纠错原则见关于本站与编辑规范。
