VibeAPIVibeAPI 开发者文档

OpenAI Chat Completions

全部 38 个请求参数、响应字段与流式事件。覆盖面最广的通用入口

POST /v1/chat/completions

覆盖面最广的入口——网关上几乎每个文本模型都能从这里调。开源项目、老框架、只认 「OpenAI 兼容」四个字的客户端,填这个准没错。

代价是它把所有模型压成同一套形状:Claude 的 thinking 块、Gemini 的 imageConfig、 Responses 的跨轮推理状态,走到这里都会被抹平。模型有原生入口就优先用原生的, 对照表见模型与入口

基本调用

建议用官方 SDK 而不是自己拼 HTTP——SSE 解析、工具参数分片拼接、超时与重试都由它处理,能避开大部分常见问题。安装与环境变量配置见快速开始

curl -N -X POST "https://www.vibeapi.cn/v1/chat/completions" \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "messages": [
      {"role": "system", "content": "你是一个简洁的助手。"},
      {"role": "user", "content": "用一句话解释什么是幂等。"}
    ],
    "stream": true
  }'
from openai import OpenAI

client = OpenAI(base_url="https://www.vibeapi.cn/v1", api_key="YOUR_API_KEY")

stream = client.chat.completions.create(
    model="gpt-6-astra",
    messages=[
        {"role": "system", "content": "你是一个简洁的助手。"},
        {"role": "user", "content": "用一句话解释什么是幂等。"},
    ],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://www.vibeapi.cn/v1",
  apiKey: "YOUR_API_KEY",
});

const stream = await client.chat.completions.create({
  model: "gpt-6-astra",
  messages: [
    { role: "system", content: "你是一个简洁的助手。" },
    { role: "user", content: "用一句话解释什么是幂等。" },
  ],
  stream: true,
});

for await (const chunk of stream) {
  const delta = chunk.choices[0]?.delta?.content;
  if (delta) process.stdout.write(delta);
}

认证

Authorization: Bearer <API_KEY>base_urlhttps://www.vibeapi.cn/v1。 OpenAI 官方 SDK 只需要换这一个值。

流式要求

请求超时上限 120 秒。非流式请求在生成完成前没有数据下行,单次生成超过这个时间就会 被中断,表现为「调用超时」。这是本网关最常见的报错原因。

短输出的非流式请求正常可用;长输出与推理型模型容易触发上限。耗时无法预判,生产 环境建议默认开启流式,需要完整文本时在客户端拼接 delta

请求参数

参数名、类型与语义对齐 OpenAI Chat Completions API。每个参数先给官方定义,再以「网关」标注本网关的实测行为。 GPT 系模型的请求体不经改写,整个参数面照单转发;标注含义:支持=有可观测证据生效;接受=正常受理、效果取决于模型本身;实测不生效=返回 200 但没有对应效果;无效=本网关不提供这项能力。

必填

modelstring必填

用于生成响应的模型 ID。可用模型见模型与入口,或调 GET /v1/models 取当前 key 能用的那份。

messagesarray必填

到目前为止的对话消息列表。每项含 roledeveloper / system / user / assistant / tool)与 content; 支持的模态取决于模型,多模态模型的 content 可为数组,混排 {"type": "text"}{"type": "image_url"}

输出控制

streamboolean默认 false

true 时以 server-sent events 边生成边返回。

网关。 单次请求上限 120 秒,推理模型建议设为 true,见流式要求

stream_optionsobject

流式选项,仅在 stream: true 时设置。{"include_usage": true} 让最后一个 chunk 带上 usage,否则流式模式下拿不到 token 统计。

max_completion_tokensinteger

本次补全可生成的 token 上限,包含可见输出与不可见的推理 token。推理模型请用它而不是 max_tokens

网关。 设得很小时 finish_reason 仍可能是 stop 而不是 length,不要用 finish_reason 判断是否被截断,以实际内容为准。

max_tokensinteger

可生成的 token 上限。官方已弃用,由 max_completion_tokens 取代,且与推理模型不兼容;保留仅为兼容旧客户端。

ninteger默认 1

为每条输入生成多少个候选回复;按所有候选的总 token 计费。

网关 · 实测不生效。 需要多个结果请并发多次调用。

stopstring | array

最多 4 个停止序列,命中即停止生成,返回文本不含该序列。最新的推理模型不支持。接受。

response_formatobject

指定模型必须输出的格式。{"type": "json_schema", "json_schema": {...}} 启用结构化输出,保证输出符合你给的 JSON Schema;{"type": "json_object"} 只保证是合法 JSON,需在提示里要求模型输出 JSON。

网关 · 支持。 两种写法都实测可用。

verbositystring默认 medium

约束回复的详略:low / medium / high。较新的模型才支持。接受。

predictionobject

预测输出(Predicted Outputs):把已知的大部分内容作为静态预测传入,命中时降低延迟。接受。

采样

temperaturenumber默认 1

采样温度,02。越高越随机,越低越集中;一般只调它或 top_p 之一。

网关。 部分推理模型忽略它或只接受默认值,取决于模型。

top_pnumber默认 1

核采样,替代温度:只考虑累计概率达到 top_p 的那部分 token,0.1 即只看前 10% 概率质量。

frequency_penaltynumber默认 0

-2.02.0。正值按 token 已出现的频次惩罚,降低逐字重复的概率。接受。

presence_penaltynumber默认 0

-2.02.0。正值按 token 是否已出现惩罚,提高谈论新话题的概率。接受。

logit_biasobject

按 token ID 调整其出现概率,取值 -100100,在采样前加到 logits 上。接受,效果取决于模型。

logprobsboolean

是否返回输出 token 的对数概率。

网关 · 实测不生效。 返回 200 但响应里没有 logprobs 字段。

top_logprobsinteger

每个位置返回最可能的 020 个 token 及其对数概率,需同时开 logprobs

网关 · 实测不生效。logprobs

seedinteger

指定后系统尽力确定性采样,相同 seed 与参数的重复请求应返回相同结果;不保证确定性,可用响应里的 system_fingerprint 监控后端变化。

网关 · 支持。 同一种子连续两次请求输出完全一致;模型版本变化后不保证跨时间一致。

reasoning_effortstring

约束推理模型的推理投入:none / minimal / low / medium / high / xhigh / max。降低投入可加快响应、减少推理 token;不是每个推理模型都支持全部取值,默认值随模型而异。

工具调用

toolsarray

模型可以调用的工具列表,可以是函数工具或自定义工具。

网关。 GPT 系工具调用语义完整;从本端点调 Claude / Gemini 属于协议转换,只保证基本的函数调用。

tool_choicestring | object

控制模型是否调用工具:none 不调用只生成消息;auto 由模型决定;required 必须调用至少一个;{"type": "function", "function": {"name": "..."}} 指定某个函数。

parallel_tool_callsboolean默认 true

是否允许一轮内并行调用多个工具。接受。

functionsarray

已弃用,由 tools 取代。仅为兼容旧客户端保留。

function_callstring | object

已弃用,由 tool_choice 取代。

web_search_optionsobject

内置联网搜索工具的选项:search_context_sizelow / medium / high)与 user_location

网关。 取决于该模型当前是否开放该能力,不保证可用。

缓存、标识与其他

prompt_cache_keystring

用于把相似请求路由到同一缓存,提高提示缓存命中率;取代 user 字段的缓存用途。

网关 · 支持。 相同前缀的第二次请求 usage 里能读到命中的缓存 token,auto 与官方满血两类 key 都可用。相同前缀带同一个 key 更容易命中,直接影响成本。

prompt_cache_optionsobject

提示缓存选项,gpt-5.6 及以后支持:mode: "explicit" 关闭隐式缓存断点,ttl 目前只支持 30m接受。

prompt_cache_retentionstring

已弃用,改用 prompt_cache_options.ttl。设为 24h 延长缓存保留。接受。

storeboolean默认 false

是否在服务端保存本次对话,供蒸馏与评测产品使用。接受。

metadataobject

最多 16 对键值,键 ≤ 64 字符、值 ≤ 512 字符,随对象存储、可供查询。接受。

userstring

终端用户的稳定标识,正被 safety_identifierprompt_cache_key 取代。接受。

safety_identifierstring

帮助识别可能违反使用政策的终端用户的稳定标识,≤ 64 字符,建议用用户名或邮箱的哈希。接受。

service_tierstring

处理类型:auto / default / flex / priority 等。

网关。 由网关自行路由,该字段无意义。

moderationobject

对输入与输出运行内容审核的配置(modelpolicy)。接受。

modalitiesarray默认 ["text"]

期望的输出类型,如 ["text"]["text", "audio"]接受。

audioobject

音频输出参数,modalitiesaudio 时必填。

网关 · 无效。 不提供音频输出模型。

响应字段

非流式返回一个 chat.completion 对象:

{
  "id": "chatcmpl-...",
  "object": "chat.completion",
  "created": 1788960000,
  "model": "gpt-6-astra",
  "choices": [
    {
      "index": 0,
      "message": { "role": "assistant", "content": "同一个操作执行多次和执行一次效果相同。", "tool_calls": null },
      "finish_reason": "stop",
      "logprobs": null
    }
  ],
  "usage": {
    "prompt_tokens": 32,
    "completion_tokens": 18,
    "total_tokens": 50,
    "completion_tokens_details": { "reasoning_tokens": 0 }
  }
}
idstring

本次补全的 id。

choices[].message.contentstring

正文。工具调用时可能为 null,内容在 tool_calls 里。

choices[].message.tool_callsarray

模型请求调用的工具及其参数(参数是 JSON 字符串,需自行解析)。

choices[].finish_reasonstring

stop 正常结束 · length 撞到输出上限 · tool_calls 等待工具结果 · content_filter 被审核拦截。

usage.completion_tokens_details.reasoning_tokensinteger

不可见的推理 token 数。它计费但不出现在正文里,推理模型上对账要看这个。

流式事件

SSE,每个事件是一个 chat.completion.chunk,增量在 choices[0].delta, 以 data: [DONE] 收尾:

data: {"object":"chat.completion.chunk","choices":[{"index":0,"delta":{"role":"assistant"}}]}

data: {"object":"chat.completion.chunk","choices":[{"index":0,"delta":{"content":"同一个"}}]}

data: {"object":"chat.completion.chunk","choices":[{"index":0,"delta":{},"finish_reason":"stop"}]}

data: [DONE]

只有一种 chunk 类型,按 delta 里出现的字段分辨内容:content 是正文增量, tool_calls 是工具调用参数的增量片段(要按 index 累积拼接)。 带了 stream_options.include_usage 时,最后一个 chunk 会额外带 usage

参数改写规则

模型触发条件网关的动作
grok-*tools 里含 web_search 类型的内置工具移除该工具,其余工具保留
grok-*reasoning.effortnone改写为 low

Claude 系模型也有一组改写规则(thinkingtemperaturetop_p),见 Messages 页——从本页调用 Claude 时同样适用。

分组差异

key 分两类:auto(可以调用全部模型)和 Claude 官方满血版对 GPT 系模型,两类 key 实测没有差异——提示缓存与内置工具在两边都可用。 差异只出现在 Claude 系模型上,见 Messages 页。

国产模型兼容度

网关上的国产模型(glm / kimi / qwen / deepseek / MiniMax)两套协议都能调通, 工具调用也都可用,但对 max_tokens、停止序列、结构化输出的遵循程度逐个模型不同, 同一模型在 Chat 协议和另一套协议上还可能表现不同。逐项实测结果见 模型与入口

其中 deepseek-v4-prokimi-k3 不执行 max_tokens,且仍将结束原因报为已截断。 使用这两个模型时,以 usage 中的实际 token 数对账。

真实响应示例

下面是从生产网关真实抓取、脱敏后的请求与响应,可以直接对照你自己的返回体。

请求 POST /v1/chat/completions

{  "model": "gpt-5.6-terra",  "max_tokens": 120,  "messages": [    {      "role": "user",      "content": "用一句话解释幂等"    }  ]}

响应

{  "id": "resp_XXXXXXXX",  "object": "chat.completion",  "created": 1788981570,  "model": "gpt-5.6-terra",  "choices": [    {      "index": 0,      "message": {        "role": "assistant",        "content": "幂等是指一个操作无论执行一次还是重复执行多次,最终产生的结果都相同。"      },      "finish_reason": "stop"    }  ],  "usage": {    "prompt_tokens": 13,    "completion_tokens": 29,    "total_tokens": 42  }}

真实调用抓取并脱敏 · 2026-09-09

模型决定调用工具时,contentnull,内容在 tool_calls 里:

请求 POST /v1/chat/completions

{  "model": "gpt-5.6-terra",  "max_tokens": 150,  "messages": [    {      "role": "user",      "content": "北京天气怎么样?用工具查"    }  ],  "tools": [    {      "type": "function",      "function": {        "name": "get_weather",        "description": "查询天气",        "parameters": {          "type": "object",          "properties": {            "city": {              "type": "string"            }          },          "required": [            "city"          ]        }      }    }  ]}

响应

{  "id": "resp_XXXXXXXX",  "object": "chat.completion",  "created": 1788981573,  "model": "gpt-5.6-terra",  "choices": [    {      "index": 0,      "message": {        "role": "assistant",        "tool_calls": [          {            "id": "call_XXXXXXXX",            "type": "function",            "function": {              "name": "get_weather",              "arguments": "{\"city\":\"北京\"}"            }          }        ]      },      "finish_reason": "tool_calls"    }  ],  "usage": {    "prompt_tokens": 46,    "completion_tokens": 18,    "total_tokens": 64  }}

真实调用抓取并脱敏 · 2026-09-09

流式的 SSE 增量(中间事件已省略):

请求 POST /v1/chat/completions

{  "model": "gpt-5.6-terra",  "max_tokens": 120,  "messages": [    {      "role": "user",      "content": "用一句话解释幂等"    }  ],  "stream": true}

响应

data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"role": "assistant"}, "finish_reason": null}]}data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"content": "幂"}, "finish_reason": null}]}data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"content": "等"}, "finish_reason": null}]}data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"content": "是"}, "finish_reason": null}]}data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [{"index": 0, "delta": {"content": "指"}, "finish_reason": null}]}… 中间的增量事件省略 …data: {"id": "resp_XXXXXXXX", "object": "chat.completion.chunk", "created": 1788981575, "model": "gpt-5.6-terra", "choices": [], "usage": {"prompt_tokens": 13, "completion_tokens": 36, "total_tokens": 49}}data: [DONE]

真实调用抓取并脱敏 · 2026-09-09

国产模型的真实响应

以下为各国产模型在 Chat 协议上的真实调用与响应,逐条折叠。

glm-5.3

请求 POST /v1/chat/completions

{  "model": "glm-5.3",  "max_tokens": 120,  "messages": [    {      "role": "user",      "content": "用一句话解释幂等"    }  ]}

响应

{  "id": "0f1fdbe9c89d462a8af7a9a92a4cc2f2",  "model": "glm-5.3",  "object": "chat.completion",  "created": 1788981605,  "choices": [    {      "index": 0,      "message": {        "role": "assistant",        "content": "## 幂等\n\n**幂等性是指执行一次操作和执行多次操作,产生的效果完全相同的特性。**\n\n例如:\n- 电梯“上行”按钮按 1 次和按 10 次,电梯只会来一趟\n- 数据库中 `SET x = 5` 执行多次,结果不变(幂等)\n- 而 `x = x + 1` 执行多次,结果会累加(非幂等)\n\n在分布式系统中,幂等性常用于保证消息重发、请求重试等场景下不会产生副作用。"      },      "finish_reason": "length"    }  ],  "usage": {    "prompt_tokens": 8,    "completion_tokens": 120,    "total_tokens": 187,    "prompt_tokens_details": {      "cached_tokens": 64,      "text_tokens": 0,      "audio_tokens": 0,      "image_tokens": 0    },    "completion_tokens_details": {      "text_tokens": 0,      "audio_tokens": 0,      "image_tokens": 0,      "reasoning_tokens": 0    },    "input_tokens": 0,    "output_tokens": 0,    "input_tokens_details": null,    "claude_cache_creation_5_m_tokens": 0,    "claude_cache_creation_1_h_tokens": 0,    "cost": 1.005328e-05  }}
kimi-k3

请求 POST /v1/chat/completions

{  "model": "kimi-k3",  "max_tokens": 120,  "messages": [    {      "role": "user",      "content": "用一句话解释幂等"    }  ]}

响应

{  "id": "msg_XXXXXXXX",  "model": "kimi-k3",  "object": "chat.completion",  "created": 1788981613,  "choices": [    {      "index": 0,      "message": {        "role": "assistant",        "content": "幂等是指同一个操作无论执行一次还是执行多次,产生的结果都相同,不会因为重复执行而带来额外的副作用。",        "reasoning_content": "User asks in Chinese: explain idempotency in one sentence."      },      "finish_reason": "stop"    }  ],  "usage": {    "prompt_tokens": 91,    "completion_tokens": 53,    "total_tokens": 144,    "usage_semantic": "openai",    "usage_source": "anthropic",    "billing_usage": {      "source": "claude_messages",      "semantic": "anthropic",      "claude_usage": {        "input_tokens": 0,        "cache_creation_input_tokens": 0,        "cache_read_input_tokens": 91,        "output_tokens": 53,        "claude_cache_creation_5_m_tokens": 0,        "claude_cache_creation_1_h_tokens": 0      }    },    "prompt_tokens_details": {      "cached_tokens": 91,      "text_tokens": 0,      "audio_tokens": 0,      "image_tokens": 0    },    "completion_tokens_details": {      "text_tokens": 0,      "audio_tokens": 0,      "image_tokens": 0,      "reasoning_tokens": 0    },    "input_tokens": 91,    "output_tokens": 0,    "input_tokens_details": null,    "claude_cache_creation_5_m_tokens": 0,    "claude_cache_creation_1_h_tokens": 0  }}
qwen3.8-max

请求 POST /v1/chat/completions

{  "model": "qwen3.8-max",  "max_tokens": 120,  "messages": [    {      "role": "user",      "content": "用一句话解释幂等"    }  ]}

响应

{  "id": "chatcmpl-XXXXXXXX",  "model": "qwen3.8",  "object": "chat.completion",  "created": 1788981701,  "choices": [    {      "index": 0,      "message": {        "role": "assistant",        "content": "\n\n幂等是指对同一操作重复执行多次,其最终结果与只执行一次相同。"      },      "finish_reason": "stop"    }  ],  "usage": {    "prompt_tokens": 57,    "completion_tokens": 61,    "total_tokens": 118,    "usage_semantic": "openai",    "usage_source": "anthropic",    "billing_usage": {      "source": "claude_messages",      "semantic": "anthropic",      "claude_usage": {        "input_tokens": 57,        "cache_creation_input_tokens": 0,        "cache_read_input_tokens": 0,        "output_tokens": 61,        "claude_cache_creation_5_m_tokens": 0,        "claude_cache_creation_1_h_tokens": 0      }    },    "prompt_tokens_details": {      "cached_tokens": 0,      "text_tokens": 0,      "audio_tokens": 0,      "image_tokens": 0    },    "completion_tokens_details": {      "text_tokens": 0,      "audio_tokens": 0,      "image_tokens": 0,      "reasoning_tokens": 0    },    "input_tokens": 57,    "output_tokens": 0,    "input_tokens_details": null,    "claude_cache_creation_5_m_tokens": 0,    "claude_cache_creation_1_h_tokens": 0  }}
deepseek-v4-pro

请求 POST /v1/chat/completions

{  "model": "deepseek-v4-pro",  "max_tokens": 120,  "messages": [    {      "role": "user",      "content": "用一句话解释幂等"    }  ]}

响应

{  "choices": [    {      "finish_reason": "stop",      "index": 0,      "logprobs": null,      "message": {        "content": "幂等是指同一个操作执行一次或多次,产生的结果和副作用都完全相同。",        "reasoning_content": "我们需要回答用户中文问题:“用一句话解释幂等”。需要一句话解释幂等概念。需要简洁准确。可能涉及计算机/接口幂等:多次执行结果与一次执行相同。用一句话解释幂等。可以回答:幂等是指同一个操作执行一次或多次,产生的效果完全相同。需要中文一句话。注意用户可能期待一句话。直接给。",        "role": "assistant"      }    }  ],  "created": 1788981705,  "id": "021788981703296cb4471f0f910e4739f2e6b993dd0a5357fe208",  "model": "deepseek-v4-pro-ga-260813",  "object": "chat.completion",  "usage": {    "completion_tokens": 93,    "prompt_tokens": 88,    "total_tokens": 181,    "prompt_tokens_details": {      "cached_tokens": 0    },    "completion_tokens_details": {      "reasoning_tokens": 75    }  }}
MiniMax-M3

请求 POST /v1/chat/completions

{  "model": "MiniMax-M3",  "max_tokens": 120,  "messages": [    {      "role": "user",      "content": "用一句话解释幂等"    }  ]}

响应

{  "id": "06f0e4cb68d236beb63570359d33c153",  "choices": [    {      "finish_reason": "stop",      "index": 0,      "message": {        "content": "幂等是指对同一个操作执行一次和执行多次的效果完全相同,不会因为重复执行而改变最终结果。",        "role": "assistant",        "name": "MiniMax AI",        "audio_content": "",        "reasoning_content": "用户要求用一句话解释幂等。这是一个计算机科学/数学概念。",        "reasoning_details": [          {            "type": "reasoning.text",            "id": "reasoning-text-1",            "format": "MiniMax-response-v1",            "index": 0,            "text": "用户要求用一句话解释幂等。这是一个计算机科学/数学概念。"          }        ]      }    }  ],  "created": 1788981707,  "model": "MiniMax-M3",  "object": "chat.completion",  "usage": {    "total_tokens": 220,    "total_characters": 0,    "prompt_tokens": 181,    "completion_tokens": 39,    "completion_tokens_details": {      "reasoning_tokens": 16    },    "prompt_tokens_details": {      "cached_tokens": 156    }  },  "input_sensitive": false,  "output_sensitive": false,  "input_sensitive_type": 0,  "output_sensitive_type": 0,  "output_sensitive_int": 0,  "base_resp": {    "status_code": 0,    "status_msg": ""  }}
glm-5.3 · 工具调用

请求 POST /v1/chat/completions

{  "model": "glm-5.3",  "max_tokens": 200,  "messages": [    {      "role": "user",      "content": "北京天气怎么样?用工具查"    }  ],  "tools": [    {      "type": "function",      "function": {        "name": "get_weather",        "description": "查询天气",        "parameters": {          "type": "object",          "properties": {            "city": {              "type": "string"            }          },          "required": [            "city"          ]        }      }    }  ]}

响应

{  "id": "e710e15a5b0d4ece915e6340a7b77900",  "model": "glm-5.3",  "object": "chat.completion",  "created": 1788981711,  "choices": [    {      "index": 0,      "message": {        "role": "assistant",        "content": null,        "tool_calls": [          {            "id": "call_XXXXXXXX",            "type": "function",            "function": {              "name": "get_weather",              "arguments": "{\"city\":\"北京\"}"            }          }        ]      },      "finish_reason": "tool_calls"    }  ],  "usage": {    "prompt_tokens": 148,    "completion_tokens": 12,    "total_tokens": 219,    "prompt_tokens_details": {      "cached_tokens": 192,      "text_tokens": 0,      "audio_tokens": 0,      "image_tokens": 0    },    "completion_tokens_details": {      "text_tokens": 0,      "audio_tokens": 0,      "image_tokens": 0,      "reasoning_tokens": 0    },    "input_tokens": 0,    "output_tokens": 0,    "input_tokens_details": null,    "claude_cache_creation_5_m_tokens": 0,    "claude_cache_creation_1_h_tokens": 0,    "cost": 1e-05  }}

以上为真实调用抓取并脱敏 · 2026-09-09

能力边界

  • 不等价于原生协议。 Claude 模型从这里调 thinking 块会丢,Gemini 的生图参数会丢。 调用成功不代表功能完整。
  • n 不保证生效。 需要多个结果请并发多次调用。
  • 不提供音频模型audio / modalities: ["audio"] 无效。
  • 不是所有官方端点都有。 /v1/assistants/v1/batches/v1/fine_tuning 不在提供范围内。

在线调试

填入你自己的 API Key 即可直接发起请求,参数表与响应结构由接口定义生成。

POST
/v1/chat/completions

Authorization

BearerAuth

AuthorizationBearer <token>

使用 Bearer Token 认证。 格式: Authorization: Bearer sk-xxxxxx

In: header

Request Body

application/json

model*string

模型 ID

messages*

对话消息列表

temperature?number

采样温度

Default1
Range0 <= value <= 2
top_p?number

核采样参数

Default1
Range0 <= value <= 1
n?integer

生成数量

Default1
Range1 <= value
stream?boolean

是否流式响应

Defaultfalse
stream_options?
stop?string|

停止序列

max_tokens?integer

最大生成 Token 数

max_completion_tokens?integer

最大补全 Token 数

presence_penalty?number
Default0
Range-2 <= value <= 2
frequency_penalty?number
Default0
Range-2 <= value <= 2
logit_bias?
user?string
tools?
tool_choice?string|
response_format?
seed?integer
reasoning_effort?string

推理强度 (用于支持推理的模型)

Value in"low" | "medium" | "high"
modalities?array<string>
audio?

Response Body

application/json

application/json

application/json

curl -X POST "https://www.vibeapi.cn/v1/chat/completions" \  -H "Content-Type: application/json" \  -d '{    "model": "gpt-4",    "messages": [      {        "role": "system",        "content": "string"      }    ]  }'
{
  "id": "string",
  "object": "chat.completion",
  "created": 0,
  "model": "string",
  "choices": [
    {
      "index": 0,
      "message": {
        "role": "system",
        "content": "string",
        "name": "string",
        "tool_calls": [
          {
            "id": "string",
            "type": "function",
            "function": {
              "name": "string",
              "arguments": "string"
            }
          }
        ],
        "tool_call_id": "string",
        "reasoning_content": "string"
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 0,
    "completion_tokens": 0,
    "total_tokens": 0,
    "prompt_tokens_details": {
      "cached_tokens": 0,
      "text_tokens": 0,
      "audio_tokens": 0,
      "image_tokens": 0
    },
    "completion_tokens_details": {
      "text_tokens": 0,
      "audio_tokens": 0,
      "reasoning_tokens": 0
    }
  },
  "system_fingerprint": "string"
}
{
  "error": {
    "message": "string",
    "type": "string",
    "param": "string",
    "code": "string"
  }
}
{
  "error": {
    "message": "string",
    "type": "string",
    "param": "string",
    "code": "string"
  }
}

官方文档

本页只写与本网关有关的部分,参数语义的权威定义以官方为准: