Appearance
Qwen3 推理服务 API 手册 v0.2.0
本手册涵盖 Qwen3 推理服务(4090 单卡部署,模型
qwen3.5:9b)的 API 调用方法。 服务提供 OpenAI 兼容 的 Chat Completions 接口,可用 cURL 或 OpenAI SDK 调用。
一、概述
Qwen3 推理服务基于 4090 单卡部署,提供大模型对话/文本生成能力。接口遵循 OpenAI Chat Completions 规范,支持 OpenAI API 的工具可零改造接入,只需替换访问地址与 API Key。
访问入口:在平台界面点击调用,即可展示 Qwen3 推理服务的 API 调用方法。 
二、连接信息
| 项目 | 值 |
|---|---|
| 访问地址 | https://llm-001.rrz.ospreyai.cn/v1/chat/completions |
| API Key | sk-xiaoyikeji0516 |
| 模型名 | qwen3.5:9b |
| 鉴权方式 | Bearer Token(请求头 Authorization: Bearer <API Key>) |
安全提示:API Key 即调用凭证,请勿提交到公开仓库或泄露给无关人员。

三、请求 Body 参数
请求体为 JSON,核心字段如下:
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
model | string | 是 | 模型名,本服务填 qwen3.5:9b |
messages | array | 是 | 对话消息列表,每条含 role 与 content |
temperature | float | 否 | 采样温度,值越大越发散;确定性任务调低,创意任务调高 |
max_tokens | int | 否 | 生成最大 token 数,超长会被截断(finish_reason 变 length) |
stream | bool | 否 | 是否流式返回,true=流式(SSE),false=一次性返回 |
messages 中的 role 取值
| role | 含义 |
|---|---|
system | 系统提示词,设定角色/风格/输出约束,放首条 |
user | 用户输入 |
assistant | 模型历史回复(多轮对话时传入) |
最小 Body 示例
json
{
"model": "qwen3.5:9b",
"messages": [
{"role": "user", "content": "你好!"}
],
"temperature": 0.7,
"max_tokens": 2048,
"stream": false
}带 system 的多轮 Body 示例
json
{
"model": "qwen3.5:9b",
"messages": [
{"role": "system", "content": "你是一名专业的技术写作助手,回答简洁准确。"},
{"role": "user", "content": "什么是 RESTful API?"},
{"role": "assistant", "content": "RESTful API 是基于 HTTP 和 REST 架构风格的接口设计规范。"},
{"role": "user", "content": "它和 GraphQL 有什么区别?"}
],
"temperature": 0.7,
"max_tokens": 2048
}上述参数为 OpenAI Chat Completions 兼容字段;服务实际支持的参数与默认值以服务返回为准。
四、cURL 调用
bash
curl -X POST "https://llm-001.rrz.ospreyai.cn/v1/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-xiaoyikeji0516" \
-d '{
"model": "qwen3.5:9b",
"messages": [
{"role": "user", "content": "你好!"}
],
"temperature": 0.7,
"max_tokens": 2048,
"stream": false
}'五、Python(OpenAI SDK)调用
先安装 SDK:pip install openai
python
from openai import OpenAI
client = OpenAI(
api_key="sk-xiaoyikeji0516",
base_url="https://llm-001.rrz.ospreyai.cn/v1",
)
response = client.chat.completions.create(
model="qwen3.5:9b",
messages=[{"role": "user", "content": "你好!"}],
temperature=0.7,
max_tokens=2048,
stream=False,
)
print(response.choices[0].message.content)注意:
base_url到/v1为止即可,SDK 会自动拼接/chat/completions,不要把完整路径填进去。
六、返回结果
非流式调用返回 JSON,模型回复在 choices[0].message.content:
json
{
"choices": [
{
"message": {
"role": "assistant",
"content": "你好!有什么可以帮你的吗?"
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 5,
"completion_tokens": 12,
"total_tokens": 17
}
}choices[0].message.content:模型生成的文本,业务取这里finish_reason:stop=正常结束,length=被max_tokens截断usage:本次调用的 token 统计
上图为示意结构,实际字段以服务返回为准。能取到
choices[0].message.content即说明联通成功。

七、常见问题
| 问题现象 | 可能原因 | 解决方案 |
|---|---|---|
| 返回 401 Unauthorized | API Key 错误或未传 | 检查请求头 Authorization: Bearer sk-xiaoyikeji0516,Key 无多余空格 |
| 返回 404 / model not found | model 名写错 | 确认 model 为 qwen3.5:9b,注意大小写与冒号 |
| SDK 报 base_url 错误 | 路径填多或填少 | base_url 到 /v1 为止,不含 /chat/completions |
| https 连不上 | 网络/证书问题 | 改用 http://llm-001.rrz.ospreyai.cn/v1/chat/completions |
| 生成内容被截断 | max_tokens 过小 | 调大 max_tokens;检查 finish_reason 是否为 length |
更新日志
| 版本 | 日期 | 更新内容 |
|---|---|---|
| v0.2.0 | 2026.07.21 | 新增「请求 Body 参数」章节:核心字段、role 取值、最小与多轮 Body 示例 |
| v0.1.0 | 2026.07.21 | 初始版本 |