GPU云主机安装Tesla驱动(Linux)

背景信息

GPU云主机仅支持安装与其操作系统一致的GPU驱动,本文中重点为您介绍手动安装Linux操作系统的Tesla驱动的相关操作。

说明
如果您创建的GPU云主机为Windows操作系统,需要安装Windows操作系统的Tesla驱动,请参见GPU云主机安装Tesla驱动(Windows)。

适用场景

本文操作适用于以下情况同时满足的业务场景:

  • 如果您在创建GPU云主机时未配置自动安装Tesla驱动,或者使用自定义镜像未安装Tesla驱动,您可以参考本文操作手动安装Tesla驱动。
  • 针对深度学习、AI等通用计算业务场景,如果您需要使用Linux操作系统的GPU云主机应用于该场景时,建议您安装Tesla驱动(Linux)。
  • 针对CentOS、Ubuntu、Debain三种Linux操作系统的GPU云主机,如您需安装Tesla驱动(Linux),请参考本文操作。
  • 针对BC-Linux操作系统,可参考CentOS章节操作。

操作步骤

  1. 访问NVIDIA 官网驱动下载中心。
  2. 设置搜索条件后,单击查找选择适用的驱动程序。

设置项目说明如下:

设置项

说明

示例

产品类型
产品系列
产品家族

根据实例规格配备的GPU选择对应的产品类型、产品系列和产品家族。查看实例规格信息的具体操作,请参见查看实例信息。

各GPU计算型规格的GPU信息的如下表所示。

Data Center / Tesla
T-Series
Tesla T4
操作系统

根据实例使用的镜像选择对应的Linux操作系统版本。

如果下拉列表中没有显示所需的操作系统,请单击下拉列表底部的选择所有操作系统。如果您未能找到与实例镜像完全匹配的Linux操作系统版本,请选择Linux 64-bit。本帮助中心驱动安装示例为操作系统选择Linux-64-bit 时Run文件格式驱动安装示例。

Linux-64-bit

CUDA Toolkit

选择CUDA Toolkit版本。

12.2

语言

选择驱动对应的语言。

Chinese (Simplified)

各GPU计算型规格的GPU信息如下:

信息项

g4a

g4v

g4t

g3v

g3t

g2

g1

产品类型

Data Center / Tesla

Data Center / Tesla

Data Center / Tesla

Data Center / Tesla

Data Center / Tesla

Data Center / Tesla

Data Center / Tesla

产品系列

A-Series

V-Series

T-Series

V-Series

T-Series

P-Series

P-Series

产品家族

A100

V100-s

T4

V100-s

T4

P40

P40

3. 在搜索到的驱动页面,单击展开查看更多版本。

4. 找到待下载的驱动,单击对应驱动后的查看。

例如,选择驱动版本为535.86.10、CUDA工具包版本为12.2的Data Center Driver for Linux x64。

5. 在待下载驱动的详情页面,右键单击下载并选择复制链接地址。

注意
win11用户获取链接可能异常,请优先使用win10获取。

6. 远程连接实例,可以选择VNC方式。

7. 使用wget命令,并粘贴您在步骤5中复制的驱动下载链接,执行命令下载安装包。命令示例如下所示:

wget --referer=https://www.nvidia.cn/ https://cn.download.nvidia.com/tesla/535.86.10/NVIDIA-Linux-x86_64-535.86.10.run

8. 安装Tesla驱动。

不同操作系统安装Tesla驱动的方法有所不同,具体操作如下所示:

CentOS操作系统

a.  如果您的操作系统为CentOS,请执行以下命令,查询实例中是否安装kernel-devel和kernel-headers包。

rpm -qa | grep $(uname -r)

b.  如果回显类似如下信息,即包含了kernel-devel和kernel-headers包的版本信息,表示已安装。

kernel-3.10.0-1062.18.1.el7.x86_64
kernel-devel-3.10.0-1062.18.1.el7.x86_64
kernel-headers-3.10.0-1062.18.1.el7.x86_64

c.  如果在回显信息中,您没有找到kernel-devel-*和kernel-headers-*内容,您需要自行下载并安装默认kernel对应版本的kernel-devel和kernel-headers包,可参考如下指令:

yum -y install kernel-headers-$(uname -r)
yum -y install kernel-devel-$(uname -r)
注意
kernel-devel和kernel版本不一致会导致在安装driver rpm过程中driver编译出错。因此,请您确认回显信息中kernel-*的版本号后,再下载对应版本的kernel-devel。在示例回显信息中,kernel的版本号为3.10.0-1062.18.1.el7.x86_64。目前只有centos7.9可以自动下载,其他版本均需要用户自行下载相关rpm包进行安装。

       d.  如果您的操作系统未安装编译工具,您需要安装gcc 、gcc-c++、make。

yum -y install gcc gcc-c++ make

e.  如果您的系统nouveau已加载,需要禁用nouveau驱动,如未加载,请跳过本步骤。

检查 nouveau driver 有没有被加载。

lsmod |grep nouveau

如下输出表明nouveau驱动已加载需要禁用nouveau驱动。

在 /usr/lib/modprobe.d/dist-blacklist.conf 中添加两行内容:

blacklist nouveau
options nouveau modeset=0

给当前镜像做备份。

mv /boot/initramfs-$(uname -r).img /boot/initramfs-$(uname -r).img.bak

建立新镜像。

dracut /boot/initramfs-$(uname -r).img $(uname -r)

重启操作系统。

reboot

检查nouveau驱动加载情况。

lsmod |grep nouveau

如无输出,表明nouveau驱动已禁用。

f.  授权并安装Tesla驱动,本文以操作系统是Linux 64-bit的驱动为例,您下载的Tesla驱动为.run格式,例如:NVIDIA-Linux-x86_64-535.86.10.run。分别执行以下命令,授权并安装Tesla驱动。

chmod +x NVIDIA-Linux-x86_64-535.86.10.run
sh NVIDIA-Linux-x86_64-535.86.10.run

g.  安装完成后,重启操作系统,执行如下命令,查看是否安装成功。

reboot

h.  待系统重启后登录云主机,执行如下命令,查看是否安装成功。

nvidia-smi

回显信息类似如下所示,表示Tesla驱动安装成功。

i.(可选)开启驱动持久化模式。具体操作,请参见GPU驱动开启持久化模式。

说明
Tesla驱动安装完成后,Persistence-M默认为关闭(off)状态,Tesla驱动在开启Persistence-M属性状态下性能更稳定。为了业务更稳定地进行,建议您开启Persistence-M属性。更多信息,请参见Persistence Daemon。

Ubuntu操作系统

a.  如果您的操作系统为Ubuntu,请添加如下步骤执行。

禁用 nouveau 驱动。

vim /etc/modprobe.d/blacklist-nouveau.conf

文件最后加入以下内容。

blacklist nouveau
options nouveau modeset=0

b.  更新使其生效。

update-initramfs -u

c.  重启机器。

reboot

重启后查看确认。

lsmod | grep nouveau

没有内容输出,说明禁用成功。

d.  安装gcc/cmake。

依次执行。

apt-get update
apt-get install gcc
apt-get install cmake

查看gcc版本。

gcc --version
cmake --version

有版本号显示说明安装成功。

e.  授权并安装Tesla驱动,本文以操作系统是Linux 64-bit的驱动为例,您下载的Tesla驱动为.run格式,例如:NVIDIA-Linux-x86_64-535.86.10.run。分别执行以下命令,授权并安装Tesla驱动。

chmod +x NVIDIA-Linux-x86_64-535.86.10.run
sh NVIDIA-Linux-x86_64-535.86.10.run

f.  安装完成后,重启操作系统,执行如下命令,查看是否安装成功。

reboot

g.  系统重启后,登录云主机,执行如下命令,查看是否安装成功。

nvidia-smi

回显信息类似如下所示,表示Tesla驱动安装成功。

h. (可选)开启驱动持久化模式。具体操作,请参见GPU驱动开启持久化模式。

说明
Tesla驱动安装完成后,Persistence-M默认为关闭(off)状态,Tesla驱动在开启Persistence-M属性状态下性能更稳定。为了业务更稳定地进行,建议您开启Persistence-M属性。更多信息,请参见Persistence Daemon。

Debian操作系统

a.  如果您的操作系统为Debian,请添加如下步骤执行。

禁用 nouveau 驱动。

vim /etc/modprobe.d/blacklist-nouveau.conf

文件最后加入以下内容。

blacklist nouveau
options nouveau modeset=0

b.  更新使其生效。

update-initramfs -u

c.  重启机器。

reboot

重启后查看确认。

lsmod | grep nouveau

没有内容输出,说明禁用成功。

d.  安装gcc/cmake。

依次执行。

apt-get update
apt-get install gcc
apt-get install cmake

查看gcc版本。

gcc --version
cmake --version

有版本号显示说明安装成功。

e.  下载默认内核对应的headers软件包。

apt-get install linux-headers-$(uname -r)

若执行上述命令有如下返回,请您根据提示版本信息手动下载上传至云主机进行安装。

f.  授权并安装Tesla驱动,本文以操作系统是Linux 64-bit的驱动为例,您下载的Tesla驱动为.run格式,例如:NVIDIA-Linux-x86_64-535.86.10.run。分别执行以下命令,授权并安装Tesla驱动。

chmod +x NVIDIA-Linux-x86_64-535.86.10.run
sh NVIDIA-Linux-x86_64-535.86.10.run

g.  安装完成后,重启操作系统,执行如下命令,查看是否安装成功。

reboot

h.  系统重启后,登录云主机,执行如下命令,查看是否安装成功。

nvidia-smi

回显信息类似如下所示,表示Tesla驱动安装成功。

i. (可选)开启驱动持久化模式。具体操作,请参见GPU驱动开启持久化模式。

说明
Tesla驱动安装完成后,Persistence-M默认为关闭(off)状态,Tesla驱动在开启Persistence-M属性状态下性能更稳定。为了业务更稳定地进行,建议您开启Persistence-M属性。更多信息,请参见Persistence Daemon。
本文档内容整理自移动云官方帮助中心(查看原文),仅供参考。