Appearance
4090 训练/JupyterLab 环境手册 v0.2.0
本手册涵盖 4090 单卡训练/实验环境(基于 JupyterLab)的使用方法,适用于自行编写训练代码、跑现成训练脚本、交互式实验调试等通用场景。
一、概述
本环境提供单张 NVIDIA RTX 4090(24 GB 显存)算力,通过 JupyterLab 网页访问,内置终端可直接调用 4090 主机 CLI。环境基于 CUDA 12.8 / 驱动 570.211.01,可用于模型训练、微调、推理调试与交互式实验。
访问入口:在平台界面点击实例入口,即可跳转至 JupyterLab。

二、访问与登录
2.1 进入实例
- 在平台「正在运行」界面找到对应的训练实例
- 点击进入,跳转至 JupyterLab 登录页
- 输入密码
123456登录

2.2 选择终端
登录后,在 JupyterLab 启动器中点击「Terminal」打开终端,即可调用 4090 主机的命令行。

提示:也可在 JupyterLab 顶栏
File → New → Terminal打开新终端。
三、确认 GPU 环境
打开终端后,首先确认 4090 可用:
bash
nvidia-smi正常输出示例(关键信息):
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 570.211.01 Driver Version: 570.211.01 CUDA Version: 12.8 |
|-----------------------------------------+------------------------+----------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
|=========================================+========================+======================|
| 0 NVIDIA GeForce RTX 4090 Off | 00000000:00:10.0 Off | Off |
| 30% 36C P8 28W / 450W | 1MiB / 24564MiB | 0% Default |
+-----------------------------------------------------------------------------------------+关注点:
| 字段 | 含义 | 说明 |
|---|---|---|
| GPU Name | 显卡型号 | 应为 NVIDIA GeForce RTX 4090 |
| Memory-Usage | 显存占用 | 1MiB / 24564MiB 表示 24 GB,空闲时占用极低 |
| GPU-Util | GPU 利用率 | 空闲时 0%,训练时应升高 |
| CUDA Version | 运行时支持的最高 CUDA | 12.8 |
若
nvidia-smi报command not found或No devices were found,说明显卡未挂载,需联系管理员。

四、环境与依赖管理
4.1 查看 Python / pip
bash
python --version
pip --version4.2 安装深度学习框架
环境是否预装框架不确定,首次使用前先验证;未装则按需安装。
PyTorch(推荐,4090 用 CUDA 12.x 轮子)
bash
# 验证是否已装
python -c "import torch; print(torch.__version__, torch.cuda.is_available())"
# 未装则安装(CUDA 12.1 轮子,兼容 4090/CUDA 12.8)
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121TensorFlow
bash
python -c "import tensorflow as tf; print(tf.__version__, tf.config.list_physical_devices('GPU'))"
# 未装则安装
pip install tensorflow[and-cuda]安装后务必确认
torch.cuda.is_available()返回True(PyTorch)或list_physical_devices('GPU')非空(TensorFlow),否则训练仍跑在 CPU 上。
4.3 安装其他依赖
bash
# 一次性安装 requirements.txt
pip install -r requirements.txt
# 安装单个包
pip install <包名>4.4 常用工具检查
bash
# git(拉代码)
git --version
# conda(如环境预装)
conda --version五、上传与运行代码
5.1 上传文件
方式一:JupyterLab 拖拽上传
在 JupyterLab 左侧文件浏览器中,直接把文件/文件夹拖入,或在目录区右键 Upload。

方式二:git 克隆
bash
git clone <仓库地址>
cd <仓库名>5.2 运行 Python 脚本
终端中直接运行:
bash
python train.py带参数运行(按脚本实际参数):
bash
python train.py --batch_size 16 --epochs 10 --lr 1e-45.3 运行 Notebook
双击左侧 .ipynb 文件打开,逐 Cell 执行(Shift+Enter),适合交互式调参与可视化。
提示:在 Notebook 中确认使用 GPU,需在 Cell 内显式指定设备,例如 PyTorch 的
device = "cuda"。
六、使用 Notebook
Notebook(.ipynb)是 JupyterLab 的核心功能,适合交互式写代码、即时看结果、调参与可视化。相比终端跑 .py 脚本,它把代码、输出、图表、说明文字组织在一个文档里,便于探索和记录。
6.1 新建 Notebook
在 JupyterLab 启动器中点击「Notebook」(或顶栏 File → New → Notebook),选择 kernel(默认为环境自带的 Python kernel)即进入编辑界面。

6.2 界面与基本操作
Notebook 由一个个 Cell(单元格) 组成,有两种类型:
| Cell 类型 | 作用 | 执行 |
|---|---|---|
| Code(代码) | 写 Python 代码,执行后显示输出 | Shift+Enter 运行并跳到下一格 |
| Markdown(文字) | 写标题、说明、公式等文档内容 | Shift+Enter 渲染 |
常用快捷键(在 Cell 外按):
| 快捷键 | 作用 |
|---|---|
Shift+Enter | 运行当前 Cell 并新建/跳到下一格 |
Ctrl+Enter | 运行当前 Cell,光标停留 |
A | 在上方插入新 Cell |
B | 在下方插入新 Cell |
D D(连按两次) | 删除当前 Cell |
M | 当前 Cell 转 Markdown |
Y | 当前 Cell 转 Code |
Python 代码示例: 
6.3 一个最小示例:确认 GPU 并训练
新建 Notebook 后,依次粘贴运行以下 Cell,演示"确认环境 → 用 GPU 跑一小段计算"的完整流程:
Cell 1(确认 GPU)
python
import torch
print("PyTorch:", torch.__version__)
print("CUDA 可用:", torch.cuda.is_available())
print("GPU:", torch.cuda.get_device_name(0) if torch.cuda.is_available() else "无")Cell 2(在 GPU 上做一次张量计算)
python
device = "cuda" if torch.cuda.is_available() else "cpu"
x = torch.randn(1000, 1000, device=device)
y = x @ x
print("结果 shape:", y.shape, "device:", y.device)逐格 Shift+Enter 运行,Cell 2 输出 device: cuda 即说明 Notebook 正确使用 4090。
6.4 Kernel 管理
Notebook 的"后台"是 Kernel(运行进程)。常见操作(顶栏 Kernel 菜单):
| 操作 | 作用 | 何时用 |
|---|---|---|
| Restart Kernel | 重启进程,清空所有变量 | 改了依赖/环境变量后生效 |
| Restart & Run All | 重启并从头跑所有 Cell | 改完代码想整体复现一遍 |
| Interrupt Kernel | 中断当前运行 | 训练跑飞/卡住想停下来 |
| Shutdown Kernel | 关闭进程,释放显存 | Notebook 不用了,释放 4090 显存 |
重要:关闭 Notebook 标签页不会自动释放显存。不用时务必
Shutdown Kernel,否则残留 Kernel 会持续占用 GPU 显存,导致下次 OOM。
6.5 保存与导出
- 保存:
Ctrl+S,或顶栏File → Save Notebook - 导出:
File → Export Notebook As…,可导出.py、.html、.pdf等,便于分享与归档
七、监控 GPU 占用
训练时另开一个终端实时监控,确认任务确实跑在 GPU 上、避免显存溢出:
bash
# 每 1 秒刷新一次
watch -n 1 nvidia-smi关注指标:
| 指标 | 异常含义 | 处理 |
|---|---|---|
| GPU-Util 长期 0% | 训练跑在 CPU 上 | 检查代码是否指定 cuda、框架是否识别 GPU |
| Memory-Usage 接近 24564MiB | 显存将溢出(OOM) | 调小 batch_size、关闭占用显存的进程 |
| 多个进程占用 | 残留进程未释放 | nvidia-smi 查 PID,kill -9 <PID> 释放 |
查看占用显存的进程:
bash
nvidia-smi
# 在 Processes 区找到 PID,再:
kill -9 <PID>八、常用 CLI 命令速查
| 命令 | 作用 |
|---|---|
nvidia-smi | 查看 GPU 状态(显存/利用率/进程) |
watch -n 1 nvidia-smi | 每秒刷新 GPU 状态 |
python train.py | 运行训练脚本 |
python -c "import torch; print(torch.cuda.is_available())" | 确认 PyTorch 能用 GPU |
pip install <包> | 安装依赖 |
pip install -r requirements.txt | 批量安装依赖 |
git clone <url> | 克隆代码 |
kill -9 <PID> | 强制结束进程、释放显存 |
九、常见问题
| 问题现象 | 可能原因 | 解决方案 |
|---|---|---|
nvidia-smi 报 command not found | 显卡驱动未装/未挂载 | 联系管理员检查实例 GPU 挂载 |
| 训练跑在 CPU,GPU-Util 为 0% | 框架未识别 GPU / 代码未指定 cuda | 确认 torch.cuda.is_available() 为 True;代码显式指定 device="cuda" |
torch.cuda.is_available() 返回 False | PyTorch 装成 CPU 版 / CUDA 版本不匹配 | 按 4.2 重装 CUDA 轮子(--index-url .../cu121) |
| CUDA out of memory(OOM) | batch_size 过大 / 残留进程占显存 | 调小 batch_size;nvidia-smi 查 PID 并 kill -9 释放 |
| pip 安装超时 | 网络问题 | 加镜像源,如 pip install <包> -i https://pypi.tuna.tsinghua.edu.cn/simple |
| 终端无响应 | 任务卡死 | 另开终端 kill -9 <PID>;或重启 JupyterLab |
| Notebook 找不到 GPU | kernel 未加载正确环境 | 重启 kernel;确认安装框架的 Python 与 Notebook kernel 一致 |
十、注意事项
- 单卡 24 GB 显存,大模型训练/微调请按显存合理设置 batch_size,OOM 是最常见问题
- 训练时另开终端监控
nvidia-smi,确认 GPU 真在跑 - 长任务建议用
nohup或tmux后台运行,避免浏览器关闭导致中断:bashnohup python train.py > train.log 2>&1 & - 实例停止后,未保存到持久目录的数据可能丢失,重要结果及时下载备份
更新日志
| 版本 | 日期 | 更新内容 |
|---|---|---|
| v0.2.0 | 2026.07.21 | 新增「使用 Notebook」章节:新建、Cell 与快捷键、GPU 最小示例、Kernel 管理、保存导出 |
| v0.1.0 | 2026.07.21 | 初始版本:访问登录、GPU 确认、依赖安装、上传运行、GPU 监控、CLI 速查与常见问题 |