OpenAI Chat Completions
全部 38 个请求参数、响应字段与流式事件。覆盖面最广的通用入口
POST /v1/chat/completions
覆盖面最广的入口——网关上几乎每个文本模型都能从这里调。开源项目、老框架、只认 「OpenAI 兼容」四个字的客户端,填这个准没错。
代价是它把所有模型压成同一套形状:Claude 的 thinking 块、Gemini 的 imageConfig、
Responses 的跨轮推理状态,走到这里都会被抹平。模型有原生入口就优先用原生的,
对照表见模型与入口。
基本调用
建议用官方 SDK 而不是自己拼 HTTP——SSE 解析、工具参数分片拼接、超时与重试都由它处理,能避开大部分常见问题。安装与环境变量配置见快速开始。
curl -N -X POST "https://www.vibeapi.cn/v1/chat/completions" \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"messages": [
{"role": "system", "content": "你是一个简洁的助手。"},
{"role": "user", "content": "用一句话解释什么是幂等。"}
],
"stream": true
}'from openai import OpenAI
client = OpenAI(base_url="https://www.vibeapi.cn/v1", api_key="YOUR_API_KEY")
stream = client.chat.completions.create(
model="gpt-6-astra",
messages=[
{"role": "system", "content": "你是一个简洁的助手。"},
{"role": "user", "content": "用一句话解释什么是幂等。"},
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://www.vibeapi.cn/v1",
apiKey: "YOUR_API_KEY",
});
const stream = await client.chat.completions.create({
model: "gpt-6-astra",
messages: [
{ role: "system", content: "你是一个简洁的助手。" },
{ role: "user", content: "用一句话解释什么是幂等。" },
],
stream: true,
});
for await (const chunk of stream) {
const delta = chunk.choices[0]?.delta?.content;
if (delta) process.stdout.write(delta);
}认证
Authorization: Bearer <API_KEY>,base_url 为 https://www.vibeapi.cn/v1。
OpenAI 官方 SDK 只需要换这一个值。
流式要求
请求超时上限 120 秒。非流式请求在生成完成前没有数据下行,单次生成超过这个时间就会 被中断,表现为「调用超时」。这是本网关最常见的报错原因。
短输出的非流式请求正常可用;长输出与推理型模型容易触发上限。耗时无法预判,生产
环境建议默认开启流式,需要完整文本时在客户端拼接 delta。
请求参数
参数名、类型与语义对齐 OpenAI Chat Completions API。每个参数先给官方定义,再以「网关」标注本网关的实测行为。 GPT 系模型的请求体不经改写,整个参数面照单转发;标注含义:支持=有可观测证据生效;接受=正常受理、效果取决于模型本身;实测不生效=返回 200 但没有对应效果;无效=本网关不提供这项能力。
必填
modelstring必填用于生成响应的模型 ID。可用模型见模型与入口,或调
GET /v1/models取当前 key 能用的那份。messagesarray必填到目前为止的对话消息列表。每项含
role(developer/system/user/assistant/tool)与content; 支持的模态取决于模型,多模态模型的content可为数组,混排{"type": "text"}与{"type": "image_url"}。
输出控制
streamboolean默认false为
true时以 server-sent events 边生成边返回。网关。 单次请求上限 120 秒,推理模型建议设为
true,见流式要求。stream_optionsobject流式选项,仅在
stream: true时设置。{"include_usage": true}让最后一个 chunk 带上usage,否则流式模式下拿不到 token 统计。max_completion_tokensinteger本次补全可生成的 token 上限,包含可见输出与不可见的推理 token。推理模型请用它而不是
max_tokens。网关。 设得很小时
finish_reason仍可能是stop而不是length,不要用finish_reason判断是否被截断,以实际内容为准。max_tokensinteger可生成的 token 上限。官方已弃用,由
max_completion_tokens取代,且与推理模型不兼容;保留仅为兼容旧客户端。ninteger默认1为每条输入生成多少个候选回复;按所有候选的总 token 计费。
网关 · 实测不生效。 需要多个结果请并发多次调用。
stopstring | array最多 4 个停止序列,命中即停止生成,返回文本不含该序列。最新的推理模型不支持。接受。
response_formatobject指定模型必须输出的格式。
{"type": "json_schema", "json_schema": {...}}启用结构化输出,保证输出符合你给的 JSON Schema;{"type": "json_object"}只保证是合法 JSON,需在提示里要求模型输出 JSON。网关 · 支持。 两种写法都实测可用。
verbositystring默认medium约束回复的详略:
low/medium/high。较新的模型才支持。接受。predictionobject预测输出(Predicted Outputs):把已知的大部分内容作为静态预测传入,命中时降低延迟。接受。
采样
temperaturenumber默认1采样温度,
0–2。越高越随机,越低越集中;一般只调它或top_p之一。网关。 部分推理模型忽略它或只接受默认值,取决于模型。
top_pnumber默认1核采样,替代温度:只考虑累计概率达到
top_p的那部分 token,0.1即只看前 10% 概率质量。frequency_penaltynumber默认0-2.0–2.0。正值按 token 已出现的频次惩罚,降低逐字重复的概率。接受。presence_penaltynumber默认0-2.0–2.0。正值按 token 是否已出现惩罚,提高谈论新话题的概率。接受。logit_biasobject按 token ID 调整其出现概率,取值
-100–100,在采样前加到 logits 上。接受,效果取决于模型。logprobsboolean是否返回输出 token 的对数概率。
网关 · 实测不生效。 返回 200 但响应里没有
logprobs字段。top_logprobsinteger每个位置返回最可能的
0–20个 token 及其对数概率,需同时开logprobs。网关 · 实测不生效。 同
logprobs。seedinteger指定后系统尽力确定性采样,相同
seed与参数的重复请求应返回相同结果;不保证确定性,可用响应里的system_fingerprint监控后端变化。网关 · 支持。 同一种子连续两次请求输出完全一致;模型版本变化后不保证跨时间一致。
reasoning_effortstring约束推理模型的推理投入:
none/minimal/low/medium/high/xhigh/max。降低投入可加快响应、减少推理 token;不是每个推理模型都支持全部取值,默认值随模型而异。
工具调用
toolsarray模型可以调用的工具列表,可以是函数工具或自定义工具。
网关。 GPT 系工具调用语义完整;从本端点调 Claude / Gemini 属于协议转换,只保证基本的函数调用。
tool_choicestring | object控制模型是否调用工具:
none不调用只生成消息;auto由模型决定;required必须调用至少一个;{"type": "function", "function": {"name": "..."}}指定某个函数。parallel_tool_callsboolean默认true是否允许一轮内并行调用多个工具。接受。
functionsarray已弃用,由
tools取代。仅为兼容旧客户端保留。function_callstring | object已弃用,由
tool_choice取代。web_search_optionsobject内置联网搜索工具的选项:
search_context_size(low/medium/high)与user_location。网关。 取决于该模型当前是否开放该能力,不保证可用。
缓存、标识与其他
prompt_cache_keystring用于把相似请求路由到同一缓存,提高提示缓存命中率;取代
user字段的缓存用途。网关 · 支持。 相同前缀的第二次请求
usage里能读到命中的缓存 token,auto与官方满血两类 key 都可用。相同前缀带同一个 key 更容易命中,直接影响成本。prompt_cache_optionsobject提示缓存选项,
gpt-5.6及以后支持:mode: "explicit"关闭隐式缓存断点,ttl目前只支持30m。接受。prompt_cache_retentionstring已弃用,改用
prompt_cache_options.ttl。设为24h延长缓存保留。接受。storeboolean默认false是否在服务端保存本次对话,供蒸馏与评测产品使用。接受。
metadataobject最多 16 对键值,键 ≤ 64 字符、值 ≤ 512 字符,随对象存储、可供查询。接受。
userstring终端用户的稳定标识,正被
safety_identifier与prompt_cache_key取代。接受。safety_identifierstring帮助识别可能违反使用政策的终端用户的稳定标识,≤ 64 字符,建议用用户名或邮箱的哈希。接受。
service_tierstring处理类型:
auto/default/flex/priority等。网关。 由网关自行路由,该字段无意义。
moderationobject对输入与输出运行内容审核的配置(
model、policy)。接受。modalitiesarray默认["text"]期望的输出类型,如
["text"]或["text", "audio"]。接受。audioobject音频输出参数,
modalities含audio时必填。网关 · 无效。 不提供音频输出模型。
响应字段
非流式返回一个 chat.completion 对象:
{
"id": "chatcmpl-...",
"object": "chat.completion",
"created": 1788960000,
"model": "gpt-6-astra",
"choices": [
{
"index": 0,
"message": { "role": "assistant", "content": "同一个操作执行多次和执行一次效果相同。", "tool_calls": null },
"finish_reason": "stop",
"logprobs": null
}
],
"usage": {
"prompt_tokens": 32,
"completion_tokens": 18,
"total_tokens": 50,
"completion_tokens_details": { "reasoning_tokens": 0 }
}
}idstring本次补全的 id。
choices[].message.contentstring正文。工具调用时可能为
null,内容在tool_calls里。choices[].message.tool_callsarray模型请求调用的工具及其参数(参数是 JSON 字符串,需自行解析)。
choices[].finish_reasonstringstop正常结束 ·length撞到输出上限 ·tool_calls等待工具结果 ·content_filter被审核拦截。usage.completion_tokens_details.reasoning_tokensinteger不可见的推理 token 数。它计费但不出现在正文里,推理模型上对账要看这个。
流式事件
SSE,每个事件是一个 chat.completion.chunk,增量在 choices[0].delta,
以 data: [DONE] 收尾:
data: {"object":"chat.completion.chunk","choices":[{"index":0,"delta":{"role":"assistant"}}]}
data: {"object":"chat.completion.chunk","choices":[{"index":0,"delta":{"content":"同一个"}}]}
data: {"object":"chat.completion.chunk","choices":[{"index":0,"delta":{},"finish_reason":"stop"}]}
data: [DONE]只有一种 chunk 类型,按 delta 里出现的字段分辨内容:content 是正文增量,
tool_calls 是工具调用参数的增量片段(要按 index 累积拼接)。
带了 stream_options.include_usage 时,最后一个 chunk 会额外带 usage。
参数改写规则
| 模型 | 触发条件 | 网关的动作 |
|---|---|---|
grok-* | tools 里含 web_search 类型的内置工具 | 移除该工具,其余工具保留 |
grok-* | reasoning.effort 为 none | 改写为 low |
Claude 系模型也有一组改写规则(thinking、temperature、top_p),见
Messages 页——从本页调用 Claude 时同样适用。
分组差异
key 分两类:auto(可以调用全部模型)和 Claude 官方满血版。
对 GPT 系模型,两类 key 实测没有差异——提示缓存与内置工具在两边都可用。
差异只出现在 Claude 系模型上,见 Messages 页。
国产模型兼容度
网关上的国产模型(glm / kimi / qwen / deepseek / MiniMax)两套协议都能调通,
工具调用也都可用,但对 max_tokens、停止序列、结构化输出的遵循程度逐个模型不同,
同一模型在 Chat 协议和另一套协议上还可能表现不同。逐项实测结果见
模型与入口。
其中 deepseek-v4-pro 与 kimi-k3 不执行 max_tokens,且仍将结束原因报为已截断。
使用这两个模型时,以 usage 中的实际 token 数对账。
真实响应示例
下面是从生产网关真实抓取、脱敏后的请求与响应,可以直接对照你自己的返回体。
请求 POST /v1/chat/completions
{ "model": "gpt-5.6-terra", "max_tokens": 120, "messages": [ { "role": "user", "content": "用一句话解释幂等" } ]}响应
{ "id": "resp_XXXXXXXX", "object": "chat.completion", "created": 1788981570, "model": "gpt-5.6-terra", "choices": [ { "index": 0, "message": { "role": "assistant", "content": "幂等是指一个操作无论执行一次还是重复执行多次,最终产生的结果都相同。" }, "finish_reason": "stop" } ], "usage": { "prompt_tokens": 13, "completion_tokens": 29, "total_tokens": 42 }}真实调用抓取并脱敏 · 2026-09-09
模型决定调用工具时,content 为 null,内容在 tool_calls 里:
请求 POST /v1/chat/completions
{ "model": "gpt-5.6-terra", "max_tokens": 150, "messages": [ { "role": "user", "content": "北京天气怎么样?用工具查" } ], "tools": [ { "type": "function", "function": { "name": "get_weather", "description": "查询天气", "parameters": { "type": "object", "properties": { "city": { "type": "string" } }, "required": [ "city" ] } } } ]}响应
{ "id": "resp_XXXXXXXX", "object": "chat.completion", "created": 1788981573, "model": "gpt-5.6-terra", "choices": [ { "index": 0, "message": { "role": "assistant", "tool_calls": [ { "id": "call_XXXXXXXX", "type": "function", "function": { "name": "get_weather", "arguments": "{\"city\":\"北京\"}" } } ] }, "finish_reason": "tool_calls" } ], "usage": { "prompt_tokens": 46, "completion_tokens": 18, "total_tokens": 64 }}真实调用抓取并脱敏 · 2026-09-09
流式的 SSE 增量(中间事件已省略):
请求 POST /v1/chat/completions
{ "model": "gpt-5.6-terra", "max_tokens": 120, "messages": [ { "role": "user", "content": "用一句话解释幂等" } ], "stream": true}响应
data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"role": "assistant"}, "finish_reason": null}]}data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"content": "幂"}, "finish_reason": null}]}data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"content": "等"}, "finish_reason": null}]}data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"content": "是"}, "finish_reason": null}]}data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"content": "指"}, "finish_reason": null}]}… 中间的增量事件省略 …data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [], "usage": {"prompt_tokens": 13, "completion_tokens": 36, "total_tokens": 49}}data: [DONE]真实调用抓取并脱敏 · 2026-09-09
国产模型的真实响应
以下为各国产模型在 Chat 协议上的真实调用与响应,逐条折叠。
▸glm-5.3
请求 POST /v1/chat/completions
{ "model": "glm-5.3", "max_tokens": 120, "messages": [ { "role": "user", "content": "用一句话解释幂等" } ]}响应
{ "id": "0f1fdbe9c89d462a8af7a9a92a4cc2f2", "model": "glm-5.3", "object": "chat.completion", "created": 1788981605, "choices": [ { "index": 0, "message": { "role": "assistant", "content": "## 幂等\n\n**幂等性是指执行一次操作和执行多次操作,产生的效果完全相同的特性。**\n\n例如:\n- 电梯“上行”按钮按 1 次和按 10 次,电梯只会来一趟\n- 数据库中 `SET x = 5` 执行多次,结果不变(幂等)\n- 而 `x = x + 1` 执行多次,结果会累加(非幂等)\n\n在分布式系统中,幂等性常用于保证消息重发、请求重试等场景下不会产生副作用。" }, "finish_reason": "length" } ], "usage": { "prompt_tokens": 8, "completion_tokens": 120, "total_tokens": 187, "prompt_tokens_details": { "cached_tokens": 64, "text_tokens": 0, "audio_tokens": 0, "image_tokens": 0 }, "completion_tokens_details": { "text_tokens": 0, "audio_tokens": 0, "image_tokens": 0, "reasoning_tokens": 0 }, "input_tokens": 0, "output_tokens": 0, "input_tokens_details": null, "claude_cache_creation_5_m_tokens": 0, "claude_cache_creation_1_h_tokens": 0, "cost": 1.005328e-05 }}▸kimi-k3
请求 POST /v1/chat/completions
{ "model": "kimi-k3", "max_tokens": 120, "messages": [ { "role": "user", "content": "用一句话解释幂等" } ]}响应
{ "id": "msg_XXXXXXXX", "model": "kimi-k3", "object": "chat.completion", "created": 1788981613, "choices": [ { "index": 0, "message": { "role": "assistant", "content": "幂等是指同一个操作无论执行一次还是执行多次,产生的结果都相同,不会因为重复执行而带来额外的副作用。", "reasoning_content": "User asks in Chinese: explain idempotency in one sentence." }, "finish_reason": "stop" } ], "usage": { "prompt_tokens": 91, "completion_tokens": 53, "total_tokens": 144, "usage_semantic": "openai", "usage_source": "anthropic", "billing_usage": { "source": "claude_messages", "semantic": "anthropic", "claude_usage": { "input_tokens": 0, "cache_creation_input_tokens": 0, "cache_read_input_tokens": 91, "output_tokens": 53, "claude_cache_creation_5_m_tokens": 0, "claude_cache_creation_1_h_tokens": 0 } }, "prompt_tokens_details": { "cached_tokens": 91, "text_tokens": 0, "audio_tokens": 0, "image_tokens": 0 }, "completion_tokens_details": { "text_tokens": 0, "audio_tokens": 0, "image_tokens": 0, "reasoning_tokens": 0 }, "input_tokens": 91, "output_tokens": 0, "input_tokens_details": null, "claude_cache_creation_5_m_tokens": 0, "claude_cache_creation_1_h_tokens": 0 }}▸qwen3.8-max
请求 POST /v1/chat/completions
{ "model": "qwen3.8-max", "max_tokens": 120, "messages": [ { "role": "user", "content": "用一句话解释幂等" } ]}响应
{ "id": "chatcmpl-XXXXXXXX", "model": "qwen3.8", "object": "chat.completion", "created": 1788981701, "choices": [ { "index": 0, "message": { "role": "assistant", "content": "\n\n幂等是指对同一操作重复执行多次,其最终结果与只执行一次相同。" }, "finish_reason": "stop" } ], "usage": { "prompt_tokens": 57, "completion_tokens": 61, "total_tokens": 118, "usage_semantic": "openai", "usage_source": "anthropic", "billing_usage": { "source": "claude_messages", "semantic": "anthropic", "claude_usage": { "input_tokens": 57, "cache_creation_input_tokens": 0, "cache_read_input_tokens": 0, "output_tokens": 61, "claude_cache_creation_5_m_tokens": 0, "claude_cache_creation_1_h_tokens": 0 } }, "prompt_tokens_details": { "cached_tokens": 0, "text_tokens": 0, "audio_tokens": 0, "image_tokens": 0 }, "completion_tokens_details": { "text_tokens": 0, "audio_tokens": 0, "image_tokens": 0, "reasoning_tokens": 0 }, "input_tokens": 57, "output_tokens": 0, "input_tokens_details": null, "claude_cache_creation_5_m_tokens": 0, "claude_cache_creation_1_h_tokens": 0 }}▸deepseek-v4-pro
请求 POST /v1/chat/completions
{ "model": "deepseek-v4-pro", "max_tokens": 120, "messages": [ { "role": "user", "content": "用一句话解释幂等" } ]}响应
{ "choices": [ { "finish_reason": "stop", "index": 0, "logprobs": null, "message": { "content": "幂等是指同一个操作执行一次或多次,产生的结果和副作用都完全相同。", "reasoning_content": "我们需要回答用户中文问题:“用一句话解释幂等”。需要一句话解释幂等概念。需要简洁准确。可能涉及计算机/接口幂等:多次执行结果与一次执行相同。用一句话解释幂等。可以回答:幂等是指同一个操作执行一次或多次,产生的效果完全相同。需要中文一句话。注意用户可能期待一句话。直接给。", "role": "assistant" } } ], "created": 1788981705, "id": "021788981703296cb4471f0f910e4739f2e6b993dd0a5357fe208", "model": "deepseek-v4-pro-ga-260813", "object": "chat.completion", "usage": { "completion_tokens": 93, "prompt_tokens": 88, "total_tokens": 181, "prompt_tokens_details": { "cached_tokens": 0 }, "completion_tokens_details": { "reasoning_tokens": 75 } }}▸MiniMax-M3
请求 POST /v1/chat/completions
{ "model": "MiniMax-M3", "max_tokens": 120, "messages": [ { "role": "user", "content": "用一句话解释幂等" } ]}响应
{ "id": "06f0e4cb68d236beb63570359d33c153", "choices": [ { "finish_reason": "stop", "index": 0, "message": { "content": "幂等是指对同一个操作执行一次和执行多次的效果完全相同,不会因为重复执行而改变最终结果。", "role": "assistant", "name": "MiniMax AI", "audio_content": "", "reasoning_content": "用户要求用一句话解释幂等。这是一个计算机科学/数学概念。", "reasoning_details": [ { "type": "reasoning.text", "id": "reasoning-text-1", "format": "MiniMax-response-v1", "index": 0, "text": "用户要求用一句话解释幂等。这是一个计算机科学/数学概念。" } ] } } ], "created": 1788981707, "model": "MiniMax-M3", "object": "chat.completion", "usage": { "total_tokens": 220, "total_characters": 0, "prompt_tokens": 181, "completion_tokens": 39, "completion_tokens_details": { "reasoning_tokens": 16 }, "prompt_tokens_details": { "cached_tokens": 156 } }, "input_sensitive": false, "output_sensitive": false, "input_sensitive_type": 0, "output_sensitive_type": 0, "output_sensitive_int": 0, "base_resp": { "status_code": 0, "status_msg": "" }}▸glm-5.3 · 工具调用
请求 POST /v1/chat/completions
{ "model": "glm-5.3", "max_tokens": 200, "messages": [ { "role": "user", "content": "北京天气怎么样?用工具查" } ], "tools": [ { "type": "function", "function": { "name": "get_weather", "description": "查询天气", "parameters": { "type": "object", "properties": { "city": { "type": "string" } }, "required": [ "city" ] } } } ]}响应
{ "id": "e710e15a5b0d4ece915e6340a7b77900", "model": "glm-5.3", "object": "chat.completion", "created": 1788981711, "choices": [ { "index": 0, "message": { "role": "assistant", "content": null, "tool_calls": [ { "id": "call_XXXXXXXX", "type": "function", "function": { "name": "get_weather", "arguments": "{\"city\":\"北京\"}" } } ] }, "finish_reason": "tool_calls" } ], "usage": { "prompt_tokens": 148, "completion_tokens": 12, "total_tokens": 219, "prompt_tokens_details": { "cached_tokens": 192, "text_tokens": 0, "audio_tokens": 0, "image_tokens": 0 }, "completion_tokens_details": { "text_tokens": 0, "audio_tokens": 0, "image_tokens": 0, "reasoning_tokens": 0 }, "input_tokens": 0, "output_tokens": 0, "input_tokens_details": null, "claude_cache_creation_5_m_tokens": 0, "claude_cache_creation_1_h_tokens": 0, "cost": 1e-05 }}以上为真实调用抓取并脱敏 · 2026-09-09
能力边界
- 不等价于原生协议。 Claude 模型从这里调 thinking 块会丢,Gemini 的生图参数会丢。 调用成功不代表功能完整。
n不保证生效。 需要多个结果请并发多次调用。- 不提供音频模型,
audio/modalities: ["audio"]无效。 - 不是所有官方端点都有。
/v1/assistants、/v1/batches、/v1/fine_tuning不在提供范围内。
在线调试
填入你自己的 API Key 即可直接发起请求,参数表与响应结构由接口定义生成。
Authorization
BearerAuth
使用 Bearer Token 认证。
格式: Authorization: Bearer sk-xxxxxx
In: header
Request Body
application/json
模型 ID
对话消息列表
采样温度
10 <= value <= 2核采样参数
10 <= value <= 1生成数量
11 <= value是否流式响应
false停止序列
最大生成 Token 数
最大补全 Token 数
0-2 <= value <= 20-2 <= value <= 2推理强度 (用于支持推理的模型)
"low" | "medium" | "high"Response Body
application/json
application/json
application/json
curl -X POST "https://www.vibeapi.cn/v1/chat/completions" \ -H "Content-Type: application/json" \ -d '{ "model": "gpt-4", "messages": [ { "role": "system", "content": "string" } ] }'{
"id": "string",
"object": "chat.completion",
"created": 0,
"model": "string",
"choices": [
{
"index": 0,
"message": {
"role": "system",
"content": "string",
"name": "string",
"tool_calls": [
{
"id": "string",
"type": "function",
"function": {
"name": "string",
"arguments": "string"
}
}
],
"tool_call_id": "string",
"reasoning_content": "string"
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 0,
"completion_tokens": 0,
"total_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0,
"text_tokens": 0,
"audio_tokens": 0,
"image_tokens": 0
},
"completion_tokens_details": {
"text_tokens": 0,
"audio_tokens": 0,
"reasoning_tokens": 0
}
},
"system_fingerprint": "string"
}{
"error": {
"message": "string",
"type": "string",
"param": "string",
"code": "string"
}
}{
"error": {
"message": "string",
"type": "string",
"param": "string",
"code": "string"
}
}官方文档
本页只写与本网关有关的部分,参数语义的权威定义以官方为准: