加入收藏 | 设为首页 | 会员中心 | 我要投稿 站长网 (https://www.92codes.com/)- 云服务器、云原生、边缘计算、云计算、混合云存储!
当前位置: 首页 > 服务器 > 搭建环境 > Linux > 正文

Linux深度学习环境搭建全流程指南

发布时间:2026-08-09 14:13:33 所属栏目:Linux 来源:DaWei
导读:  Linux深度学习环境搭建需兼顾系统稳定性、硬件兼容性与开发效率。推荐使用Ubuntu 22.04 LTS或CentOS Stream 8作为基础系统,避免过新或过旧的内核导致驱动冲突。安装时勾选“安装第三方驱动”选项,确保NVIDIA显

  Linux深度学习环境搭建需兼顾系统稳定性、硬件兼容性与开发效率。推荐使用Ubuntu 22.04 LTS或CentOS Stream 8作为基础系统,避免过新或过旧的内核导致驱动冲突。安装时勾选“安装第三方驱动”选项,确保NVIDIA显卡基础支持就绪。


  驱动安装是关键前置步骤。访问NVIDIA官网下载与显卡型号匹配的.run驱动包(如535.104.05),禁用默认nouveau驱动:在/etc/modprobe.d/blacklist.conf中添加“blacklist nouveau”并执行update-initramfs -u。重启进入文本模式(Ctrl+Alt+F3),运行sudo bash ./NVIDIA-Linux-.run --no-opengl-files,跳过内置OpenGL安装以避免与桌面环境冲突。


  CUDA Toolkit选择需与驱动版本严格对应。例如驱动535.x对应CUDA 12.2,从NVIDIA官网下载runfile安装包,执行sudo sh cuda_12.2.2_535.104.05_linux.run,取消勾选Driver安装(已手动安装),仅安装CUDA toolkit和cuDNN示例。安装完成后将/usr/local/cuda-12.2/bin加入PATH,/usr/local/cuda-12.2/lib64加入LD_LIBRARY_PATH,并写入~/.bashrc使配置生效。


AI绘图结果,仅供参考

  Python环境建议使用miniconda而非系统Python,避免权限与依赖污染。下载Miniconda3最新版,运行bash Miniconda3-latest-Linux-x86_64.sh -b -p $HOME/miniconda3,再执行$HOME/miniconda3/bin/conda init bash。重启终端后创建独立环境:conda create -n dl python=3.9,conda activate dl。


  PyTorch与TensorFlow需通过官方渠道安装以保障CUDA支持。PyTorch官网提供适配CUDA 12.2的pip命令:pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121;TensorFlow则使用pip install tensorflow-cpu或tensorflow-gpu(注意TF 2.13+已原生支持CUDA 12,无需单独安装cuDNN)。验证时运行python -c "import torch; print(torch.cuda.is_available())",输出True即成功。


  工具链补全可提升开发体验。Jupyter Lab通过pip install jupyterlab启动;VS Code安装Python和Remote-SSH扩展,配合conda环境自动识别;nvtop替代top实时监控GPU内存与算力。若需多机训练,提前配置SSH无密登录与NFS共享数据目录。


  最后进行端到端测试:下载小型MNIST训练脚本,设置device=torch.device("cuda"),观察GPU利用率是否跳升、训练速度是否显著快于CPU模式。常见问题包括libcudnn.so未找到(检查LD_LIBRARY_PATH)、CUDA_VISIBLE_DEVICES误设为-1、以及conda环境未激活导致pip安装到全局Python。记录每步命令与输出日志,便于回溯排查。

(编辑:站长网)

【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容!

    推荐文章