Skip to content

Qwen3 推理服务 API 手册 v0.2.0

本手册涵盖 Qwen3 推理服务(4090 单卡部署,模型 qwen3.5:9b)的 API 调用方法。 服务提供 OpenAI 兼容 的 Chat Completions 接口,可用 cURL 或 OpenAI SDK 调用。


一、概述

Qwen3 推理服务基于 4090 单卡部署,提供大模型对话/文本生成能力。接口遵循 OpenAI Chat Completions 规范,支持 OpenAI API 的工具可零改造接入,只需替换访问地址与 API Key。

访问入口:在平台界面点击调用,即可展示 Qwen3 推理服务的 API 调用方法。 11.png|697


二、连接信息

项目
访问地址https://llm-001.rrz.ospreyai.cn/v1/chat/completions
API Keysk-xiaoyikeji0516
模型名qwen3.5:9b
鉴权方式Bearer Token(请求头 Authorization: Bearer <API Key>)

安全提示:API Key 即调用凭证,请勿提交到公开仓库或泄露给无关人员。

12.png|697


三、请求 Body 参数

请求体为 JSON,核心字段如下:

参数类型必填说明
modelstring模型名,本服务填 qwen3.5:9b
messagesarray对话消息列表,每条含 rolecontent
temperaturefloat采样温度,值越大越发散;确定性任务调低,创意任务调高
max_tokensint生成最大 token 数,超长会被截断(finish_reasonlength)
streambool是否流式返回,true=流式(SSE),false=一次性返回

messages 中的 role 取值

role含义
system系统提示词,设定角色/风格/输出约束,放首条
user用户输入
assistant模型历史回复(多轮对话时传入)

最小 Body 示例

json
{
  "model": "qwen3.5:9b",
  "messages": [
    {"role": "user", "content": "你好!"}
  ],
  "temperature": 0.7,
  "max_tokens": 2048,
  "stream": false
}

带 system 的多轮 Body 示例

json
{
  "model": "qwen3.5:9b",
  "messages": [
    {"role": "system", "content": "你是一名专业的技术写作助手,回答简洁准确。"},
    {"role": "user", "content": "什么是 RESTful API?"},
    {"role": "assistant", "content": "RESTful API 是基于 HTTP 和 REST 架构风格的接口设计规范。"},
    {"role": "user", "content": "它和 GraphQL 有什么区别?"}
  ],
  "temperature": 0.7,
  "max_tokens": 2048
}

上述参数为 OpenAI Chat Completions 兼容字段;服务实际支持的参数与默认值以服务返回为准。


四、cURL 调用

bash
curl -X POST "https://llm-001.rrz.ospreyai.cn/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-xiaoyikeji0516" \
  -d '{
    "model": "qwen3.5:9b",
    "messages": [
      {"role": "user", "content": "你好!"}
    ],
    "temperature": 0.7,
    "max_tokens": 2048,
    "stream": false
  }'

五、Python(OpenAI SDK)调用

先安装 SDK:pip install openai

python
from openai import OpenAI

client = OpenAI(
    api_key="sk-xiaoyikeji0516",
    base_url="https://llm-001.rrz.ospreyai.cn/v1",
)

response = client.chat.completions.create(
    model="qwen3.5:9b",
    messages=[{"role": "user", "content": "你好!"}],
    temperature=0.7,
    max_tokens=2048,
    stream=False,
)

print(response.choices[0].message.content)

注意:base_url/v1 为止即可,SDK 会自动拼接 /chat/completions,不要把完整路径填进去。


六、返回结果

非流式调用返回 JSON,模型回复在 choices[0].message.content:

json
{
  "choices": [
    {
      "message": {
        "role": "assistant",
        "content": "你好!有什么可以帮你的吗?"
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 5,
    "completion_tokens": 12,
    "total_tokens": 17
  }
}
  • choices[0].message.content:模型生成的文本,业务取这里
  • finish_reason:stop=正常结束,length=被 max_tokens 截断
  • usage:本次调用的 token 统计

上图为示意结构,实际字段以服务返回为准。能取到 choices[0].message.content 即说明联通成功。

13.png|697


七、常见问题

问题现象可能原因解决方案
返回 401 UnauthorizedAPI Key 错误或未传检查请求头 Authorization: Bearer sk-xiaoyikeji0516,Key 无多余空格
返回 404 / model not foundmodel 名写错确认 model 为 qwen3.5:9b,注意大小写与冒号
SDK 报 base_url 错误路径填多或填少base_url/v1 为止,不含 /chat/completions
https 连不上网络/证书问题改用 http://llm-001.rrz.ospreyai.cn/v1/chat/completions
生成内容被截断max_tokens 过小调大 max_tokens;检查 finish_reason 是否为 length

更新日志

版本日期更新内容
v0.2.02026.07.21新增「请求 Body 参数」章节:核心字段、role 取值、最小与多轮 Body 示例
v0.1.02026.07.21初始版本

AI API Gateway Documentation