在阿里云 Linux 服务器上配置深度学习开发环境,通常涉及系统初始化、驱动安装、CUDA/cuDNN 配置、深度学习框架(如 PyTorch/TensorFlow)安装以及开发工具链设置。以下是完整且实用的步骤指南(以 Ubuntu 22.04 LTS + NVIDIA GPU 为例,CentOS 7/8 略有差异但逻辑一致):
🔧 一、前期准备
1. 选择合适实例
- 登录 阿里云控制台
- 创建 GPU 实例(如
gn6i、gn7、gn8等),确保包含 NVIDIA GPU(如 A10、A100、V100 等) - 推荐镜像:Ubuntu 22.04 LTS 或 CentOS 7/8(官方提供“深度学习”优化镜像更佳)
2. 安全组与网络
- 开放必要端口(如 SSH
22,Jupyter8888,VS Code Remote22) - 建议绑定弹性公网 IP(EIP)以便远程访问
🖥️ 二、系统基础配置
# 更新系统包
sudo apt update && sudo apt upgrade -y # Ubuntu
# 或
sudo yum update -y # CentOS
# 安装基础工具
sudo apt install -y vim git curl wget unzip htop net-tools build-essential
⚙️ 三、安装 NVIDIA 驱动 & CUDA Toolkit
✅ 推荐方式:使用 NVIDIA 官方
.run文件或阿里云提供的预装驱动镜像(更简单可靠)
方案 A:使用阿里云“深度学习镜像”(推荐新手)
- 创建实例时选择 “公共镜像 → 深度学习” 分类下的镜像(如
ubuntu_22_04_x64_deep_learning) - 此类镜像已预装:NVIDIA 驱动 + CUDA + cuDNN + Docker + 主流框架
方案 B:手动安装(适合自定义需求)
1. 卸载旧驱动(如有冲突)
sudo apt-get purge '^nvidia-.*'
sudo reboot
2. 添加 NVIDIA 源并安装驱动(以 Ubuntu 为例)
# 添加 NVIDIA 仓库(以 535 版本为例)
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt update
# 安装指定版本驱动 + CUDA Toolkit(例如 CUDA 12.1)
sudo apt install -y cuda-drivers-535 cuda-toolkit-12-1
💡 可先查看支持列表:
nvidia-smi --query-gpu=driver_version --format=csv
或参考 NVIDIA 驱动兼容性表
3. 验证安装
nvidia-smi
# 应显示 GPU 型号、驱动版本、CUDA 版本(如 CUDA Version: 12.1)
📦 四、安装 cuDNN 和 NCCL(若未自动包含)
CUDA Toolkit 通常自带 cuDNN,但需手动链接:
cd /usr/local/cuda-12.1/include
sudo cp cudnn*.h /usr/include/
cd /usr/local/cuda-12.1/lib64
sudo cp libcudnn* /usr/lib/x86_64-linux-gnu/
sudo chmod a+r /usr/lib/x86_64-linux-gnu/libcudnn*
# 检查符号链接
ls -l /usr/lib/x86_64-linux-gnu/libcudnn.so*
NCCL 一般由 CUDA 或独立安装:
# 可选:安装 NCCL(用于多卡通信)
wget https://developer.download.nvidia.com/compute/redist/nccl/v2.19.3/nccl_2.19.3-1+cuda12.1.x86_64.deb
sudo dpkg -i nccl_2.19.3-1+cuda12.1.x86_64.deb
🐍 五、配置 Python 环境与深度学习框架
推荐:使用 Conda + 虚拟环境(避免污染系统 Python)
# 安装 Miniconda
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh -b -p $HOME/miniconda3
source $HOME/miniconda3/bin/activate
conda init bash
创建深度学习虚拟环境
conda create -n dl-env python=3.10 -y
conda activate dl-env
# 安装 PyTorch(匹配你的 CUDA 版本!)
# 例如 CUDA 12.1:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
# 或 TensorFlow(GPU 版)
pip install tensorflow[and-cuda]==2.15.0
# 常用库
pip install numpy pandas matplotlib scikit-learn jupyterlab ipython
✅ 验证:
import torch
print(torch.__version__)
print(torch.cuda.is_available()) # True
print(torch.cuda.get_device_name(0)) # 显示 GPU 名称
🛠️ 六、部署开发工具(可选但强烈推荐)
1. JupyterLab(远程 Web IDE)
jupyter lab --generate-config
echo "c.ServerApp.ip = '0.0.0.0'" >> ~/.jupyter/jupyter_lab_config.py
echo "c.ServerApp.port = 8888" >> ~/.jupyter/jupyter_lab_config.py
echo "c.ServerApp.open_browser = False" >> ~/.jupyter/jupyter_lab_config.py
echo "c.ServerApp.password = 'your_secure_password'" >> ~/.jupyter/jupyter_lab_config.py # 或使用 token
# 启动
jupyter lab --no-browser --port=8888
→ 通过浏览器访问:http://<服务器IP>:8888
2. VS Code Remote(本地编辑 + 远程执行)
- 本地安装 VS Code + Remote – SSH 扩展
- 连接阿里云服务器后,可直接编辑代码、调试、运行终端命令
3. Docker(容器化部署,便于复用)
# 安装 Docker
curl -fsSL https://get.docker.com | sh
sudo usermod -aG docker $USER
# 安装 NVIDIA Container Toolkit(使 Docker 支持 GPU)
distribution=$(. /etc/os-release;echo $ID$VERSION_ID)
curl -s -L https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/$distribution/libnvidia-container.list |
sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit.gpg] https://#g' |
sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt update
sudo apt install -y nvidia-container-toolkit
sudo systemctl restart docker
# 测试 GPU 容器
docker run --rm --gpus all nvidia/cuda:12.1-base-ubuntu22.04 nvidia-smi
🔄 七、自动化脚本示例(一键部署)
可保存为 setup_docker_gpu.sh 供重复使用:
#!/bin/bash
set -e
# 更新系统
apt update && apt upgrade -y
# 安装依赖
apt install -y git curl wget unzip vim htop
# 安装 NVIDIA 驱动(假设已用阿里云镜像预装;否则跳过)
# nvidia-smi || { echo "No GPU driver found!"; exit 1; }
# 安装 Conda
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh -b -p $HOME/miniconda3
source $HOME/miniconda3/bin/activate
conda init bash
# 创建环境
conda create -n dl-env python=3.10 -y
conda activate dl-env
# 安装 PyTorch (CUDA 12.1)
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
pip install jupyterlab ipython
# 启动 Jupyter
jupyter lab --ip=0.0.0.0 --port=8888 --no-browser --allow-root &
echo "✅ Setup complete! Access Jupyter at http://<YOUR_IP>:8888"
📌 注意事项
| 项目 | 建议 |
|---|---|
| CUDA 版本匹配 | 必须与 PyTorch/TensorFlow 编译版本一致(见官网表格) |
| 多卡训练 | 启用 NCCL_DEBUG=INFO 排查通信问题 |
| 数据挂载 | 使用阿里云 OSS 或云盘挂载 /data 目录,避免本地存储不足 |
| 监控资源 | 安装 nvitop 实时查看 GPU 利用率:pip install nvitop |
| 备份配置 | 将 ~/.bashrc、conda env export > environment.yml 存档 |
需要我为你生成:
- 针对特定 GPU 型号(如 A100/A10)的定制化脚本?
- Docker Compose 多服务部署模板(含 TensorBoard + Weights & Biases)?
- 从本地 VS Code 无缝连接阿里云的完整 SSH 配置指南?
欢迎告诉我你的具体需求场景 😊
PHPWP博客