Skip to content

4090 训练/JupyterLab 环境手册 v0.2.0

本手册涵盖 4090 单卡训练/实验环境(基于 JupyterLab)的使用方法,适用于自行编写训练代码、跑现成训练脚本、交互式实验调试等通用场景。


一、概述

本环境提供单张 NVIDIA RTX 4090(24 GB 显存)算力,通过 JupyterLab 网页访问,内置终端可直接调用 4090 主机 CLI。环境基于 CUDA 12.8 / 驱动 570.211.01,可用于模型训练、微调、推理调试与交互式实验。

访问入口:在平台界面点击实例入口,即可跳转至 JupyterLab。

14.png|697


二、访问与登录

2.1 进入实例

  1. 在平台「正在运行」界面找到对应的训练实例
  2. 点击进入,跳转至 JupyterLab 登录页
  3. 输入密码 123456 登录

15.png|697

2.2 选择终端

登录后,在 JupyterLab 启动器中点击「Terminal」打开终端,即可调用 4090 主机的命令行。

16.png|697

提示:也可在 JupyterLab 顶栏 File → New → Terminal 打开新终端。


三、确认 GPU 环境

打开终端后,首先确认 4090 可用:

bash
nvidia-smi

正常输出示例(关键信息):

+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 570.211.01             Driver Version: 570.211.01     CUDA Version: 12.8     |
|-----------------------------------------+------------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|=========================================+========================+======================|
|   0  NVIDIA GeForce RTX 4090        Off |   00000000:00:10.0 Off |                  Off |
| 30%   36C    P8             28W /  450W |       1MiB /  24564MiB |      0%      Default |
+-----------------------------------------------------------------------------------------+

关注点:

字段含义说明
GPU Name显卡型号应为 NVIDIA GeForce RTX 4090
Memory-Usage显存占用1MiB / 24564MiB 表示 24 GB,空闲时占用极低
GPU-UtilGPU 利用率空闲时 0%,训练时应升高
CUDA Version运行时支持的最高 CUDA12.8

nvidia-smicommand not foundNo devices were found,说明显卡未挂载,需联系管理员。

17.png|697


四、环境与依赖管理

4.1 查看 Python / pip

bash
python --version
pip --version

4.2 安装深度学习框架

环境是否预装框架不确定,首次使用前先验证;未装则按需安装。

PyTorch(推荐,4090 用 CUDA 12.x 轮子)

bash
# 验证是否已装
python -c "import torch; print(torch.__version__, torch.cuda.is_available())"

# 未装则安装(CUDA 12.1 轮子,兼容 4090/CUDA 12.8)
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

TensorFlow

bash
python -c "import tensorflow as tf; print(tf.__version__, tf.config.list_physical_devices('GPU'))"

# 未装则安装
pip install tensorflow[and-cuda]

安装后务必确认 torch.cuda.is_available() 返回 True(PyTorch)或 list_physical_devices('GPU') 非空(TensorFlow),否则训练仍跑在 CPU 上。

4.3 安装其他依赖

bash
# 一次性安装 requirements.txt
pip install -r requirements.txt

# 安装单个包
pip install <>

4.4 常用工具检查

bash
# git(拉代码)
git --version

# conda(如环境预装)
conda --version

五、上传与运行代码

5.1 上传文件

方式一:JupyterLab 拖拽上传

在 JupyterLab 左侧文件浏览器中,直接把文件/文件夹拖入,或在目录区右键 Upload

image.png|697

方式二:git 克隆

bash
git clone <仓库地>
cd <仓库>

5.2 运行 Python 脚本

终端中直接运行:

bash
python train.py

带参数运行(按脚本实际参数):

bash
python train.py --batch_size 16 --epochs 10 --lr 1e-4

5.3 运行 Notebook

双击左侧 .ipynb 文件打开,逐 Cell 执行(Shift+Enter),适合交互式调参与可视化。

提示:在 Notebook 中确认使用 GPU,需在 Cell 内显式指定设备,例如 PyTorch 的 device = "cuda"


六、使用 Notebook

Notebook(.ipynb)是 JupyterLab 的核心功能,适合交互式写代码、即时看结果、调参与可视化。相比终端跑 .py 脚本,它把代码、输出、图表、说明文字组织在一个文档里,便于探索和记录。

6.1 新建 Notebook

在 JupyterLab 启动器中点击「Notebook」(或顶栏 File → New → Notebook),选择 kernel(默认为环境自带的 Python kernel)即进入编辑界面。

19.png|697

6.2 界面与基本操作

Notebook 由一个个 Cell(单元格) 组成,有两种类型:

Cell 类型作用执行
Code(代码)写 Python 代码,执行后显示输出Shift+Enter 运行并跳到下一格
Markdown(文字)写标题、说明、公式等文档内容Shift+Enter 渲染

常用快捷键(在 Cell 外按):

快捷键作用
Shift+Enter运行当前 Cell 并新建/跳到下一格
Ctrl+Enter运行当前 Cell,光标停留
A在上方插入新 Cell
B在下方插入新 Cell
D D(连按两次)删除当前 Cell
M当前 Cell 转 Markdown
Y当前 Cell 转 Code

Python 代码示例: 20.png|697

6.3 一个最小示例:确认 GPU 并训练

新建 Notebook 后,依次粘贴运行以下 Cell,演示"确认环境 → 用 GPU 跑一小段计算"的完整流程:

Cell 1(确认 GPU)

python
import torch
print("PyTorch:", torch.__version__)
print("CUDA 可用:", torch.cuda.is_available())
print("GPU:", torch.cuda.get_device_name(0) if torch.cuda.is_available() else "无")

Cell 2(在 GPU 上做一次张量计算)

python
device = "cuda" if torch.cuda.is_available() else "cpu"
x = torch.randn(1000, 1000, device=device)
y = x @ x
print("结果 shape:", y.shape, "device:", y.device)

逐格 Shift+Enter 运行,Cell 2 输出 device: cuda 即说明 Notebook 正确使用 4090。

6.4 Kernel 管理

Notebook 的"后台"是 Kernel(运行进程)。常见操作(顶栏 Kernel 菜单):

操作作用何时用
Restart Kernel重启进程,清空所有变量改了依赖/环境变量后生效
Restart & Run All重启并从头跑所有 Cell改完代码想整体复现一遍
Interrupt Kernel中断当前运行训练跑飞/卡住想停下来
Shutdown Kernel关闭进程,释放显存Notebook 不用了,释放 4090 显存

重要:关闭 Notebook 标签页不会自动释放显存。不用时务必 Shutdown Kernel,否则残留 Kernel 会持续占用 GPU 显存,导致下次 OOM。

6.5 保存与导出

  • 保存:Ctrl+S,或顶栏 File → Save Notebook
  • 导出:File → Export Notebook As…,可导出 .py.html.pdf 等,便于分享与归档

七、监控 GPU 占用

训练时另开一个终端实时监控,确认任务确实跑在 GPU 上、避免显存溢出:

bash
# 每 1 秒刷新一次
watch -n 1 nvidia-smi

关注指标:

指标异常含义处理
GPU-Util 长期 0%训练跑在 CPU 上检查代码是否指定 cuda、框架是否识别 GPU
Memory-Usage 接近 24564MiB显存将溢出(OOM)调小 batch_size、关闭占用显存的进程
多个进程占用残留进程未释放nvidia-smi 查 PID,kill -9 <PID> 释放

查看占用显存的进程:

bash
nvidia-smi
# 在 Processes 区找到 PID,再:
kill -9 <PID>

八、常用 CLI 命令速查

命令作用
nvidia-smi查看 GPU 状态(显存/利用率/进程)
watch -n 1 nvidia-smi每秒刷新 GPU 状态
python train.py运行训练脚本
python -c "import torch; print(torch.cuda.is_available())"确认 PyTorch 能用 GPU
pip install <包>安装依赖
pip install -r requirements.txt批量安装依赖
git clone <url>克隆代码
kill -9 <PID>强制结束进程、释放显存

九、常见问题

问题现象可能原因解决方案
nvidia-smi 报 command not found显卡驱动未装/未挂载联系管理员检查实例 GPU 挂载
训练跑在 CPU,GPU-Util 为 0%框架未识别 GPU / 代码未指定 cuda确认 torch.cuda.is_available() 为 True;代码显式指定 device="cuda"
torch.cuda.is_available() 返回 FalsePyTorch 装成 CPU 版 / CUDA 版本不匹配按 4.2 重装 CUDA 轮子(--index-url .../cu121)
CUDA out of memory(OOM)batch_size 过大 / 残留进程占显存调小 batch_size;nvidia-smi 查 PID 并 kill -9 释放
pip 安装超时网络问题加镜像源,如 pip install <包> -i https://pypi.tuna.tsinghua.edu.cn/simple
终端无响应任务卡死另开终端 kill -9 <PID>;或重启 JupyterLab
Notebook 找不到 GPUkernel 未加载正确环境重启 kernel;确认安装框架的 Python 与 Notebook kernel 一致

十、注意事项

  • 单卡 24 GB 显存,大模型训练/微调请按显存合理设置 batch_size,OOM 是最常见问题
  • 训练时另开终端监控 nvidia-smi,确认 GPU 真在跑
  • 长任务建议用 nohuptmux 后台运行,避免浏览器关闭导致中断:
    bash
    nohup python train.py > train.log 2>&1 &
  • 实例停止后,未保存到持久目录的数据可能丢失,重要结果及时下载备份

更新日志

版本日期更新内容
v0.2.02026.07.21新增「使用 Notebook」章节:新建、Cell 与快捷键、GPU 最小示例、Kernel 管理、保存导出
v0.1.02026.07.21初始版本:访问登录、GPU 确认、依赖安装、上传运行、GPU 监控、CLI 速查与常见问题

AI API Gateway Documentation