<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>GPU on Charlie Chiang's blog</title><link>https://charlie0129.github.io/blog/categories/gpu/</link><description>Recent content in GPU on Charlie Chiang's blog</description><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Sat, 16 Aug 2025 20:49:00 +0800</lastBuildDate><atom:link href="https://charlie0129.github.io/blog/categories/gpu/index.xml" rel="self" type="application/rss+xml"/><item><title>Proxmox VE Shared GPU Installation Guide</title><link>https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/</link><pubDate>Sat, 16 Aug 2025 20:49:00 +0800</pubDate><guid>https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/</guid><description>&lt;h2 id="introduction">Introduction
&lt;/h2>&lt;p>Most schools and universities in China have a limited number of GPU servers (often only one or two, or even none). This makes the management of GPU development machines quite different than corporation which have virtually unlimited GPU servers.&lt;/p>
&lt;p>Let&amp;rsquo;s consider a normal lab environment with 12 students, each needing a GPU server for their projects, and we have one GPU server with 8 GPUs available.&lt;/p>
&lt;ul>
&lt;li>If we give each student a dedicated GPU server, we would need 12 servers, this is impractical and costly.&lt;/li>
&lt;li>If we let all the students share a single GPU server (all students have access to all resources), it would be very difficult to manage, as each student would need to install their own software and dependencies, leading to conflicts. Soon the GPU server will become a hot mess. Making each student use a different user account would not solve the problem, as they would still share the same OS and software environment, and will potentially break each other&amp;rsquo;s environment.&lt;/li>
&lt;li>If we make use of IOMMU and PCIe passthrough, we can assign a virtual machine with one dedicated passthrough&amp;rsquo;d GPU to each student. This approach has almost no interference between students, as each student has their own OS and software environment, even with it&amp;rsquo;s own GPU. However, this leads to a lot of wasted resources, because most of the time the GPU is idle, and each student will only have access to one GPU at a time, even if all of the GPUs are idle.&lt;/li>
&lt;li>If we use GPU virtualization, we can assign a virtual machine with a shared GPU to each student. This way, each student can use the GPU resources as needed, and the GPU can be shared among multiple students. This approach is more efficient and cost-effective, as it allows for better resource utilization. However, it requires a GPU that supports virtualization, such as NVIDIA&amp;rsquo;s vGPU or AMD&amp;rsquo;s MxGPU. Most consumer GPUs do not support virtualization, so this approach is not feasible for most schools and universities.&lt;/li>
&lt;/ul>
&lt;p>This is where containerization comes in. By using containerization, we can create a shared GPU development server that runs a container for each student. Each container can have its own software environment, and all (or some of) of the GPUs can be shared among multiple containers. This approach is more efficient and cost-effective, as it allows for better resource utilization, and does not require a GPU that supports virtualization. However, it should be noted that this approach is not as isolated as virtual machines, as all containers share the same kernel and GPU resources. Therefore, it is important to ensure that the containers are properly configured, and that the students are aware of the limitations and potential issues that may arise from sharing the same GPU resources (for example, if one student runs a GPU-intensive task, it may affect the performance of other students&amp;rsquo; containers).&lt;/p>
&lt;p>We will be using the CT (LXC Containers) in Proxmox VE to achieve this. Why not use Docker? Because Docker is meant for running applications, not for running full Linux distros. Although you can use something like sysbox to run a full Linux distro in Docker, i would still prefer to use LXC Containers, as they are built for this purpose and are already built into Proxmox VE, making it easier to manage and deploy.&lt;/p>
&lt;h2 id="proxmox-ve-installation">Proxmox VE Installation
&lt;/h2>&lt;p>Download the latest Proxmox VE ISO from the &lt;a class="link" href="https://www.proxmox.com/en/downloads" target="_blank" rel="noopener"
>official website&lt;/a>. At the time of writing, the latest version is Proxmox VE 9.0. Use whatever method you prefer to install Proxmox VE, such as using a USB drive.&lt;/p>
&lt;p>I will use IPMI of the server to install Proxmox VE, as it is the most convenient method for me. You can also use a monitor and keyboard to install Proxmox VE if you prefer.&lt;/p>
&lt;p>Mount the Proxmox VE installation ISO as virtual media so we can boot into.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188.png"
width="2560"
height="1600"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_fc3819d67899781d.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_9d957dfbafccb232.jpg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_f638cbe753e8df54.webp 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_96242ea226abd1df.jpg 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_bb01bd1f795bfa17.webp 1536w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_a80d7d3f160c23f3.jpg 1536w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_2406379d72ef1f1b.webp 2048w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_d73dbdf56d3ff481.jpg 2048w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_6f21ae6ec6e3868b.webp 2560w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250816213214188_hu_7b94c32487992fd7.jpg 2560w"
loading="lazy"
alt="image-20250816213214188"
class="gallery-image"
data-flex-grow="160"
data-flex-basis="384px"
>
&lt;/p>
&lt;p>Now reboot the server into the virtual media. Supermicro motherboards lets you invode the boot menu using F11. Your motherboard may have a different shortcut.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm1.jpeg"
width="1024"
height="768"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm1_hu_8ba3cfc0a697fe04.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm1_hu_9c46554a70e3f68b.jpeg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm1_hu_c7fc7a1ae7b4113d.webp 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm1_hu_1b4cb758cf2fff8a.jpeg 1024w"
loading="lazy"
alt="kvm1"
class="gallery-image"
data-flex-grow="133"
data-flex-basis="320px"
>
&lt;/p>
&lt;p>Choose our CDROM virtual media.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm2.jpeg"
width="800"
height="600"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm2_hu_9017089d67a44bb4.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm2_hu_e0cae96a987e1778.jpeg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm2_hu_209d9180b54cd190.webp 800w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm2_hu_bb993296d9dc2ad2.jpeg 800w"
loading="lazy"
alt="kvm2"
class="gallery-image"
data-flex-grow="133"
data-flex-basis="320px"
>
&lt;/p>
&lt;p>Boot into the Proxmox install menu (I prefer terminal UI over GUI ones).&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm5.jpeg"
width="1024"
height="768"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm5_hu_bf96deb29f237104.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm5_hu_fbc78cf467a77c00.jpeg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm5_hu_9225fe3a3bdcfe99.webp 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm5_hu_d4626b04625ebb28.jpeg 1024w"
loading="lazy"
alt="kvm5"
class="gallery-image"
data-flex-grow="133"
data-flex-basis="320px"
>
&lt;/p>
&lt;p>After you accepted the license, you will need to choose the target installtion disk. You should choose the boot SSDs on your server, not data drives. The drive in picture is 3*1.92TB SSDs in RAID 5.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm6.jpeg"
width="1280"
height="1024"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm6_hu_dbb426d48c671cc8.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm6_hu_6064335627e5139e.jpeg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm6_hu_7f1d8d51d68f2aa4.webp 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm6_hu_208bd54bae9f396f.jpeg 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm6_hu_736c681430510399.webp 1280w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm6_hu_e7bd64cc7009b50f.jpeg 1280w"
loading="lazy"
alt="kvm6"
class="gallery-image"
data-flex-grow="125"
data-flex-basis="300px"
>
&lt;/p>
&lt;p>Toggle &lt;code>Advanced options&lt;/code>. Keep ext4, we will not be using ZFS. I know ZFS has CoW, snapshotting, compressing, checksums, and a ton of other features. But we will not use ZFS, because it will potentially cause some problems, e.g., high IO load when using RAID-Z zvols, extremely slow container start times when using ZFS storage driver in Docker, SSD write amplifications, low SSD random read/write performance, ZFS ARC not being given back to the OS as fast as needed on high memory pressure systems leading to OOM, and a ton of other issues that I previously encountered. To save me some trouble, I will use the battle-tested ext4.&lt;/p>
&lt;ul>
&lt;li>Total size: keep as-is&lt;/li>
&lt;li>Swap size: 0, we don&amp;rsquo;t need it, our memory is large enought (1TiB) and we will later use ZRAM as swap&lt;/li>
&lt;li>Maximum root volume size: 100 (GiB), make it slightly larger so we can install things into the root volume, but not too large to occupy the data volume space.&lt;/li>
&lt;/ul>
&lt;p>Other options can be left empty.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm7.jpeg"
width="1280"
height="1024"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm7_hu_2ff35877d03636be.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm7_hu_378d3db78e6dd1f1.jpeg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm7_hu_dc35289a6d315b63.webp 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm7_hu_5a57bbb82297cfbc.jpeg 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm7_hu_3de3e3022862cd88.webp 1280w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm7_hu_9f57d55dfbd59de8.jpeg 1280w"
loading="lazy"
alt="kvm7"
class="gallery-image"
data-flex-grow="125"
data-flex-basis="300px"
>
&lt;/p>
&lt;p>Other install steps (Keyboard setup, root password) can proceed as you normally would do. Remember to set a complex root password.&lt;/p>
&lt;p>Regarding to IP addresses:&lt;/p>
&lt;ul>
&lt;li>
&lt;p>If you are going to use a static IP address like I do, you can just set it here and forget about it.&lt;/p>
&lt;/li>
&lt;li>
&lt;p>If you are going to use a dynamic (DHCP) addresses, you should keep what&amp;rsquo;s already in here (static IP). You don&amp;rsquo;t need to change anything. The valid IP address should already be automatically discovered from DHCP servers and filled in. After the installation, you can change the static IP mode to DHCP mode by running &lt;code>vi /etc/network/interfaces&lt;/code> and make the following edits:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-diff" data-lang="diff">&lt;span class="line">&lt;span class="cl"> auto vmbr0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gd">- iface vmbr0 inet static
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gd">&lt;/span>&lt;span class="gi">+ iface vmbr0 inet dhcp # Enable DHCP and remove static IP.
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">&lt;/span>&lt;span class="gd">- address 10.112.154.220/16
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gd">- gateway 10.112.0.1
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gd">&lt;/span> bridge-ports eno1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> bridge-stp off
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> bridge-fd 0
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>After you enabled DHCP in the config, apply it by &lt;code>ifreload -a&lt;/code>. Check if it takes effect by &lt;code>ip a show vmbr0&lt;/code>, you should see something like &lt;code>valid_lft 7160sec preferred_lft 7160sec&lt;/code>. If there is no &lt;code>xx sec&lt;/code> inside it, your DHCP is malfunctioning.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="go">root@z8:/etc/network# ip a show vmbr0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">4: vmbr0: &amp;lt;BROADCAST,MULTICAST,UP,LOWER_UP&amp;gt; mtu 1500 qdisc noqueue state UP group default qlen 1000
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> link/ether 30:13:8b:6d:3a:a6 brd ff:ff:ff:ff:ff:ff
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> inet 10.112.154.220/16 brd 10.112.255.255 scope global dynamic vmbr0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> valid_lft 7160sec preferred_lft 7160sec
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> inet6 fe80::3213:8bff:fe6d:3aa6/64 scope link
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> valid_lft forever preferred_lft forever
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;/li>
&lt;/ul>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm8.jpeg"
width="1280"
height="1024"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm8_hu_f1e09d0126385e40.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm8_hu_cf2d14b24937eaa4.jpeg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm8_hu_f8717c460e0c3fb.webp 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm8_hu_c48c549747fce87b.jpeg 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm8_hu_bf0bf072e6823127.webp 1280w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm8_hu_52691de358776305.jpeg 1280w"
loading="lazy"
alt="kvm8"
class="gallery-image"
data-flex-grow="125"
data-flex-basis="300px"
>
&lt;/p>
&lt;h2 id="proxmox-ve-post-installtion">Proxmox VE Post-Installtion
&lt;/h2>&lt;p>Log in as root as we will make a few modifications.&lt;/p>
&lt;h3 id="change-apt-sources">Change APT Sources
&lt;/h3>&lt;p>In China, we don&amp;rsquo;t really have a good global Internet connection, so we will change APT source to mirrors in China.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Change APT source mirrors&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">sed -i &lt;span class="s1">&amp;#39;s/deb.debian.org/mirrors.ustc.edu.cn/g&amp;#39;&lt;/span> /etc/apt/sources.list.d/debian.sources
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">sed -i &lt;span class="s1">&amp;#39;s/security.debian.org/mirrors.ustc.edu.cn/g&amp;#39;&lt;/span> /etc/apt/sources.list.d/debian.sources
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Change Ceph source mirrors&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">if&lt;/span> &lt;span class="o">[&lt;/span> -f /etc/apt/sources.list.d/ceph.sources &lt;span class="o">]&lt;/span>&lt;span class="p">;&lt;/span> &lt;span class="k">then&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nv">CEPH_CODENAME&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="sb">`&lt;/span>ceph -v &lt;span class="p">|&lt;/span> grep ceph &lt;span class="p">|&lt;/span> awk &lt;span class="s1">&amp;#39;{print $(NF-1)}&amp;#39;&lt;/span>&lt;span class="sb">`&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nb">source&lt;/span> /etc/os-release
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> cat &amp;gt; /etc/apt/sources.list.d/ceph.sources &lt;span class="s">&amp;lt;&amp;lt;EOF
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">Types: deb
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">URIs: https://mirrors.ustc.edu.cn/proxmox/debian/ceph-$CEPH_CODENAME
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">Suites: $VERSION_CODENAME
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">Components: no-subscription
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">Signed-By: /usr/share/keyrings/proxmox-archive-keyring.gpg
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">EOF&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">fi&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Remove enterprise repo and add no-subscription repo.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Remove enterprise sources&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm /etc/apt/sources.list.d/pve-enterprise.sources
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Add no-subscription sources&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">cat &amp;gt; /etc/apt/sources.list.d/pve-no-subscription.sources &lt;span class="s">&amp;lt;&amp;lt;EOF
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">Types: deb
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">URIs: https://mirrors.ustc.edu.cn/proxmox/debian/pve
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">Suites: trixie
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">Components: pve-no-subscription
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">Signed-By: /usr/share/keyrings/proxmox-archive-keyring.gpg
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">EOF&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="change-ct-template-sources">Change CT Template Sources
&lt;/h3>&lt;p>Use mirrors in China.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">sed -i.bak &lt;span class="s1">&amp;#39;s|http://download.proxmox.com|https://mirrors.ustc.edu.cn/proxmox|g&amp;#39;&lt;/span> /usr/share/perl5/PVE/APLInfo.pm
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">systemctl restart pvedaemon
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="stop-cluster-services">Stop Cluster Services
&lt;/h3>&lt;p>We are not using PVE clusters. Disable them. If you are using PVE clusters, you probably will not be reading this guide :P&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">systemctl disable --now pve-ha-crm.service
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">systemctl disable --now pve-ha-lrm.service
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">systemctl disable --now corosync.service
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="install-common-tools">Install Common Tools
&lt;/h3>&lt;p>Useful tools that will be used regularly.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">apt install htop sysstat vim sudo
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="configure-shell">Configure Shell
&lt;/h3>&lt;p>I like ZSH and my dotfiles, so I will use them.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">apt install git zsh
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">git clone --depth&lt;span class="o">=&lt;/span>&lt;span class="m">1&lt;/span> https://github.com/charlie0129/dotfiles.git
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> dotfiles
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">./bootstrap.sh -f
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">chsh -s /usr/bin/zsh
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Run zsh and follow the instructions&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">zsh
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="configure-zram-swap">Configure ZRAM Swap
&lt;/h3>&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">git clone --depth&lt;span class="o">=&lt;/span>&lt;span class="m">1&lt;/span> https://github.com/foundObjects/zram-swap.git
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> zram-swap
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">./install.sh
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> ..
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm -rf zram-swap
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>The default lz4 is a good balance between speed and compression ratio. If you want to sacrifice speed for better compression, you can change the config to use zstd as the compression method.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">sed -i &lt;span class="s1">&amp;#39;s/_zram_algorithm=.*/_zram_algorithm=&amp;#34;zstd&amp;#34;/g&amp;#39;&lt;/span> /etc/default/zram-swap
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Apply&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">systemctl restart zram-swap
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Tune kernel parameters to make better use of ZRAM&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">cat &lt;span class="s">&amp;lt;&amp;lt;EOF &amp;gt; /etc/sysctl.d/zram.conf
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">vm.swappiness = 180
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">vm.watermark_boost_factor = 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">vm.watermark_scale_factor = 125
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">vm.page-cluster = 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">EOF&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Apply&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">sysctl --system
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="enable-ipv6-slaac">Enable IPv6 SLAAC
&lt;/h3>&lt;p>Proxmox disables IPv6 by default. To enable IPv6 SLAAC:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">cat &lt;span class="s">&amp;lt;&amp;lt;EOF &amp;gt; /etc/sysctl.d/ipv6.conf
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">net.ipv6.conf.default.accept_ra = 2
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">net.ipv6.conf.all.accept_ra = 2
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">net.ipv6.conf.default.forwarding = 1
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">net.ipv6.conf.all.forwarding = 1
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">net.ipv6.conf.default.proxy_ndp = 1
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">net.ipv6.conf.all.proxy_ndp = 1
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">EOF&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Apply it&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">sysctl --system
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Note: the following command may break your internet connection.&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">systemctl restart networking
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="trim-optimizations">TRIM Optimizations
&lt;/h3>&lt;p>TRIM will help prolong SSD lifespan and maintain performance. Enable it on the LVM thin pool.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">sed -i &lt;span class="s1">&amp;#39;s/.*issue_discards = .*/\tissue_discards = 1/g&amp;#39;&lt;/span> /etc/lvm/lvm.conf
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Since LXCs are just on the host, it will automatically issue discards if the underlying storage supports it, so no further action is needed. If you are using VM, be sure to use SCSI disks (VirtIO SCSI Single) with &lt;code>discard=on&lt;/code> option. I&amp;rsquo;ve heard that VirtIO Block devices will not work with dicards but I haven&amp;rsquo;t tested it yet. Correct me if I&amp;rsquo;m wrong.&lt;/p>
&lt;h3 id="limit-journal-size">Limit Journal Size
&lt;/h3>&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">sed -i &lt;span class="s1">&amp;#39;s/.*SystemMaxUse.*/SystemMaxUse=32M/g&amp;#39;&lt;/span> /etc/systemd/journald.conf
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Apply&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">systemctl daemon-reload
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">systemctl restart systemd-journald
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h2 id="nvidia-p2p-driver-installation">NVIDIA P2P Driver Installation
&lt;/h2>&lt;p>Instead of regular NVIDIA drivers, we will be installing P2P-enabled drivers to force enable PCIe P2P capabilities on consumer cards (like GeForce RTX 4090). This will bring performance boost (~10%) across multiple scenarios. For details, refer to my blog post: &lt;a class="link" href="https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/" >Enabling PCIe P2P on NVIDIA RTX 4090s&lt;/a>&lt;/p>
&lt;h3 id="disable-iommu">Disable IOMMU
&lt;/h3>&lt;p>Since PCIe P2P in Linux doesn&amp;rsquo;t work so well with IOMMU-enabled systems (there are many potential issues you may run into), you may as well just disable IOMMU. Note that if you have more than 255 CPU cores, you will only have access to 255 CPUs due to APIC fallback.&lt;/p>
&lt;p>To do disable IOMMU, you can either&lt;/p>
&lt;ul>
&lt;li>Disable Intel VT-d (AMD is on by default) in BIOS&lt;/li>
&lt;li>Disable &lt;code>intel_iommu&lt;/code> or &lt;code>amd_iommu&lt;/code> in Linux kernel parameters&lt;/li>
&lt;/ul>
&lt;p>To disable &lt;code>intel_iommu&lt;/code> or &lt;code>amd_iommu&lt;/code> in Linux kernel parameters, use the following command to add &lt;code>intel_iommu=off&lt;/code> and &lt;code>amd_iommu=off&lt;/code> to your &lt;code>GRUB_CMDLINE_LINUX_DEFAULT&lt;/code>. BTW: I also reduce the screen resolution to 1024x768 because it&amp;rsquo;s a server&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">sed -i &lt;span class="s1">&amp;#39;s/GRUB_CMDLINE_LINUX_DEFAULT=.*/GRUB_CMDLINE_LINUX_DEFAULT=&amp;#34;intel_iommu=off amd_iommu=off video=1024x768@60&amp;#34;/g&amp;#39;&lt;/span> /etc/default/grub
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Reboot your system to see the effect.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">reboot
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Make sure the follow command produces NO entries. If there are output, it means IOMMU is not correctly disabled.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">ls /sys/class/iommu
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="disable-acs">Disable ACS
&lt;/h3>&lt;p>You may need to disable ACS to get PCIe P2P to work, refer to &lt;a class="link" href="https://docs.nvidia.com/deeplearning/nccl/user-guide/docs/troubleshooting.html" target="_blank" rel="noopener"
>https://docs.nvidia.com/deeplearning/nccl/user-guide/docs/troubleshooting.html&lt;/a> (PCI Access Control Services)&lt;/p>
&lt;h3 id="enable-above-4g-decoding">Enable Above 4G Decoding
&lt;/h3>&lt;p>PCIe P2P will need to access each GPU&amp;rsquo;s memory, so the PCIe BAR should be large enough to cover GPU&amp;rsquo;s memory. You must enable &lt;code>Above 4G Decoding&lt;/code> in your motherboard settings to make the PCIe BAR large enough to work. Enable it in your motherboard&amp;rsquo;s BIOS.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm3.jpeg"
width="800"
height="600"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm3_hu_7e15f21db3b3c17e.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm3_hu_9e3424f688b5b212.jpeg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm3_hu_c195e513c0a13d42.webp 800w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm3_hu_7d51eb80b8d4fadf.jpeg 800w"
loading="lazy"
alt="kvm3"
class="gallery-image"
data-flex-grow="133"
data-flex-basis="320px"
>
&lt;/p>
&lt;h3 id="install-official-driver">Install Official Driver
&lt;/h3>&lt;p>Before we install the P2P kernel module, we need to install the official drivers.&lt;/p>
&lt;p>Since we are installing unofficial P2P kernel modules, there is a limited number of driver version that will work. The version of the P2P kernel modules MUST be the same as the official driver we are going to install.&lt;/p>
&lt;p>Refer to &lt;a class="link" href="https://github.com/tinygrad/open-gpu-kernel-modules" target="_blank" rel="noopener"
>https://github.com/tinygrad/open-gpu-kernel-modules&lt;/a> to see what versions are available. I also have my patches that works with much newer driver versions (&lt;code>575.57.08&lt;/code>) (at the time of writing) &lt;a class="link" href="https://github.com/charlie0129/open-gpu-kernel-modules" target="_blank" rel="noopener"
>https://github.com/charlie0129/open-gpu-kernel-modules&lt;/a> .&lt;/p>
&lt;p>I will be using version &lt;code>575.57.08&lt;/code>, so we should download the official driver of the same version (575.57.08). You should download the &lt;code>.run&lt;/code> file, e.g., &lt;code>NVIDIA-Linux-x86_64-575.57.08.run&lt;/code>&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Assume you download the installer as NVIDIA-Linux-x86_64-575.57.08.run&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nv">installer&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="s2">&amp;#34;NVIDIA-Linux-x86_64-575.57.08.run&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">chmod +x &lt;span class="nv">$installer&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Skip kernel modules because we will install P2P-patched version later.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">./&lt;span class="nv">$installer&lt;/span> --no-kernel-modules
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Choose whatever you want, doesn&amp;rsquo;t matter.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000515967.png"
width="1332"
height="936"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000515967_hu_98208fee79b653b6.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000515967_hu_8c48fb6ddb80aa09.jpg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000515967_hu_961f2daf7702c60.webp 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000515967_hu_c210bf19507e4f39.jpg 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000515967_hu_b2550ba7a4857e9c.webp 1332w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000515967_hu_e39d158f30e89b6a.jpg 1332w"
loading="lazy"
alt="image-20250817000515967"
class="gallery-image"
data-flex-grow="142"
data-flex-basis="341px"
>
&lt;/p>
&lt;p>Yes, disable nouveau, we will be using NVIDIA drivers.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000549521.png"
width="1332"
height="936"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000549521_hu_c04467322fc6b9b5.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000549521_hu_6960c0b2e9c6b7b7.jpg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000549521_hu_3b938860c46b37b2.webp 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000549521_hu_166683d5e7642037.jpg 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000549521_hu_6cffe724c88436b4.webp 1332w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000549521_hu_74c62616de8a0c23.jpg 1332w"
loading="lazy"
alt="image-20250817000549521"
class="gallery-image"
data-flex-grow="142"
data-flex-basis="341px"
>
&lt;/p>
&lt;p>Do not abort, just continue. Nouveau will be disabled on next boot.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000652879.png"
width="1332"
height="936"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000652879_hu_d23455096df2bfa2.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000652879_hu_6b7514f546ecd5da.jpg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000652879_hu_849962d25bf10f61.webp 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000652879_hu_d5e6cd44b8bf36e5.jpg 1024w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000652879_hu_7936dd81616107f0.webp 1332w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/image-20250817000652879_hu_a5cd53c580d81314.jpg 1332w"
loading="lazy"
alt="image-20250817000652879"
class="gallery-image"
data-flex-grow="142"
data-flex-basis="341px"
>
&lt;/p>
&lt;p>Just choose the default option for every step that comes later.&lt;/p>
&lt;p>Remove the driver installation file because we will not be using it later.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">rm &lt;span class="nv">$installer&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>You can skip reboot now. We will reboot after we installed the kernel modules.&lt;/p>
&lt;h3 id="install-p2p-enabled-kernel-modules">Install P2P-Enabled Kernel Modules
&lt;/h3>&lt;p>Make sure the version of the P2P-enabled kernel modules match the version of the driver. I will use veriosn 575.57.08.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">git clone --depth&lt;span class="o">=&lt;/span>&lt;span class="m">1&lt;/span> -b 575.57.08-p2p https://github.com/charlie0129/open-gpu-kernel-modules.git
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>To build kernel modules, install build dependencies and kernel source. &lt;code>sudo&lt;/code> installed because the install script uses &lt;code>sudo&lt;/code> but we don&amp;rsquo;t have it now.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">apt install sudo build-essential proxmox-headers-&lt;span class="k">$(&lt;/span>uname -r&lt;span class="k">)&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Build and install the kernel module&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">./install.sh
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>You can safely ignore the NVIDIA-SMI failure as long as the build succeeds (you should see a &lt;code>DEPMOD /lib/modules/6.14.8-2-pve&lt;/code> line) because we haven&amp;rsquo;t rebooted yet (so NVIDIA-SMI can&amp;rsquo;t be used).&lt;/p>
&lt;p>Remove the source after installing&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> ..
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm -rf open-gpu-kernel-modules
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Reboot your system and you should see &lt;code>nvidia-smi&lt;/code> running fine.&lt;/p>
&lt;p>To tell if P2P is enabled, we will use a simple method (performance testing will be done later):&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">nvidia-smi -q &lt;span class="p">|&lt;/span> grep -i bar -A &lt;span class="m">3&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>You should see &lt;code>&amp;gt; 2048 MiB&lt;/code> BAR1 Total memory, &lt;code>32768 MiB&lt;/code> in my case.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl"> BAR1 Memory Usage
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Total : 32768 MiB
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Used : 2 MiB
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Free : 32766 MiB
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="enable-persistence-mode">Enable Persistence Mode
&lt;/h3>&lt;p>Persistence mode will:&lt;/p>
&lt;ul>
&lt;li>Keep the GPU driver running so program can start faster&lt;/li>
&lt;li>Lower GPU power mode when it&amp;rsquo;s idle to save power. For RTX 4090s, it can drop from ~70W to ~10W.&lt;/li>
&lt;li>Make sure &lt;code>/dev/nvidia*&lt;/code> device nodes are ready. This is useful because we are passing the GPU devices &lt;code>/dev/nvidia*&lt;/code> to CTs (LXC Containers) later, it requires the device nodes to be present on start up for auto-started CTs.&lt;/li>
&lt;/ul>
&lt;p>So you really should enable it.&lt;/p>
&lt;p>To enable persistence mode:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">/usr/bin/nvidia-smi -pm &lt;span class="m">1&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>To make it persistent across reboots, we will use a cron job.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">crontab -e
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Add a line to run &lt;code>nvidia-smi&lt;/code> on boot:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">@reboot /usr/bin/nvidia-smi -pm &lt;span class="m">1&lt;/span> &amp;gt;/dev/null 2&amp;gt;&lt;span class="p">&amp;amp;&lt;/span>&lt;span class="m">1&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;blockquote>
&lt;p>Why not use &lt;code>nvidia-persistenced&lt;/code> systemd service? Because for whatever reason, it does not initialize the device nodes &lt;code>/dev/nvidia*&lt;/code> correctly, so auto-started CTs will encounter &lt;code>Cuda failure 'unknown error'&lt;/code>.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> /usr/share/doc/NVIDIA_GLX-1.0/samples
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">tar jxf nvidia-persistenced-init.tar.bz2
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> nvidia-persistenced-init
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">./install.sh
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;/blockquote>
&lt;p>You should feel &lt;code>nvidia-smi&lt;/code> runs much faster than before.&lt;/p>
&lt;h2 id="build-ct-templates">Build CT Templates
&lt;/h2>&lt;p>We will build a CT Template that has everything a student will need:&lt;/p>
&lt;ul>
&lt;li>Common build dependencies&lt;/li>
&lt;li>CUDA&lt;/li>
&lt;li>Docker&lt;/li>
&lt;li>&amp;hellip;&lt;/li>
&lt;/ul>
&lt;p>Download the Linux distro you want. I chose Ubuntu 24.04, not because I like Ubuntu (I use Debian), but because most students only know Ubuntu.&lt;/p>
&lt;p>Create an unprivileged CT just like you normally would. Just remember to give it a bit more disk space (32GB or more) because we will install CUDA later and CUDA is really large.&lt;/p>
&lt;h3 id="install-docker">Install Docker
&lt;/h3>&lt;p>After you created the CT, shut it down. Add additional settings to allow Docker to use overlayfs driver, otherwise Docker images will be extremely inefficient in CTs.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># This command should be run on the host, not CT.&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Assume 8000 is the ID of your template CT&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">cat &lt;span class="s">&amp;lt;&amp;lt;EOF &amp;gt;&amp;gt; /etc/pve/local/lxc/8000.conf
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.apparmor.profile: unconfined
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.cgroup.devices.allow: a
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.cap.drop:
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">EOF&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>All following commands should be run in the CT unless specified otherwise.&lt;/p>
&lt;p>Add Docker configuration. Systemd journal is used as log driver to make use of previously configured journal size limit. By writing logs to a centralized location, it&amp;rsquo;s also useful if you want to write logs to memory to reduce disk writes (e.g. log2ram).&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">mkdir -p /etc/docker/
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">cat &lt;span class="s">&amp;lt;&amp;lt;EOF &amp;gt; /etc/docker/daemon.json
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">{
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s"> &amp;#34;live-restore&amp;#34;: true,
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s"> &amp;#34;experimental&amp;#34;: true,
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s"> &amp;#34;log-driver&amp;#34;: &amp;#34;journald&amp;#34;
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">}
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">EOF&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Install Docker&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="nb">export&lt;/span> &lt;span class="nv">DOWNLOAD_URL&lt;/span>&lt;span class="o">=&lt;/span>https://mirrors.ustc.edu.cn/docker-ce
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">curl -fsSL https://get.docker.io &lt;span class="p">|&lt;/span> sh
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="revert-containerd-config">Revert Containerd Config
&lt;/h3>&lt;p>Docker modified containerd config. We will revert it to the default config.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">containerd config default &amp;gt;/etc/containerd/config.toml
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="add-gpus-to-ct">Add GPUs to CT
&lt;/h3>&lt;p>Choose which GPU you need to passthrough by looking for the index in &lt;code>nvidia-smi&lt;/code>, or by &lt;code>ls -l /dev/nvidia*&lt;/code>&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># This command should be run on the host, not CT.&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># ls -l /dev/nvidia*&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">crw-rw-rw- &lt;span class="m">1&lt;/span> root root 195, &lt;span class="m">0&lt;/span> 2025-08-17 01:47:58 /dev/nvidia0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">crw-rw-rw- &lt;span class="m">1&lt;/span> root root 195, &lt;span class="m">1&lt;/span> 2025-08-17 01:48:00 /dev/nvidia1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">crw-rw-rw- &lt;span class="m">1&lt;/span> root root 195, &lt;span class="m">2&lt;/span> 2025-08-17 01:48:01 /dev/nvidia2
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">crw-rw-rw- &lt;span class="m">1&lt;/span> root root 195, &lt;span class="m">3&lt;/span> 2025-08-17 01:48:02 /dev/nvidia3
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">crw-rw-rw- &lt;span class="m">1&lt;/span> root root 195, &lt;span class="m">4&lt;/span> 2025-08-17 01:48:03 /dev/nvidia4
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">crw-rw-rw- &lt;span class="m">1&lt;/span> root root 195, &lt;span class="m">5&lt;/span> 2025-08-17 01:48:05 /dev/nvidia5
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">crw-rw-rw- &lt;span class="m">1&lt;/span> root root 195, &lt;span class="m">6&lt;/span> 2025-08-17 01:48:06 /dev/nvidia6
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">crw-rw-rw- &lt;span class="m">1&lt;/span> root root 195, &lt;span class="m">7&lt;/span> 2025-08-17 01:48:07 /dev/nvidia7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">... &lt;span class="o">(&lt;/span>omitted&lt;span class="o">)&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>For example, if want to add all 8 GPUs (0, 1, 2, 3, 4, 5, 6, 7) to CT, I will need to run:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># This command should be run on the host, not CT.&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Assume 8000 is the ID of your template CT&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">cat &lt;span class="s">&amp;lt;&amp;lt;EOF &amp;gt;&amp;gt; /etc/pve/local/lxc/8000.conf
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia0 dev/nvidia0 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia1 dev/nvidia1 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia2 dev/nvidia2 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia3 dev/nvidia3 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia4 dev/nvidia4 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia5 dev/nvidia5 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia6 dev/nvidia6 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia7 dev/nvidia7 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidiactl dev/nvidiactl none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia-modeset dev/nvidia-modeset none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia-uvm dev/nvidia-uvm none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/nvidia-uvm-tools dev/nvidia-uvm-tools none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/dri dev/dri none bind,optional,create=dir
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">lxc.mount.entry: /dev/fb0 dev/fb0 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s">EOF&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Note the &lt;code>lxc.mount.entry: /dev/nvidiaX dev/nvidiaX none bind,optional,create=file&lt;/code> lines. Each line represents a single GPU to add to the CT. I will add 8 GPUs, so I add 8 lines from &lt;code>nvidia0&lt;/code> through &lt;code>nvidia7&lt;/code>. Remove or add them as needed.&lt;/p>
&lt;p>Check if the GPUs are there inside CT:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-gdscript3" data-lang="gdscript3">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># ls -l /dev/nvidia*&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">48&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">00&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">modeset&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">50&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">43&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">uvm&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">50&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">43&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">uvm&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">tools&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">47&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">58&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia0&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">48&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">00&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia1&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">48&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">01&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia2&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">48&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">02&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia3&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">48&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">03&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia4&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">48&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">05&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia5&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">48&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">06&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia6&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">48&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">07&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidia7&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">crw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="n">rw&lt;/span>&lt;span class="o">-&lt;/span> &lt;span class="n">nobody&lt;/span> &lt;span class="n">nogroup&lt;/span> &lt;span class="mi">0&lt;/span> &lt;span class="n">B&lt;/span> &lt;span class="mi">2025&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">08&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">17&lt;/span> &lt;span class="mi">01&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">47&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">58&lt;/span> &lt;span class="o">/&lt;/span>&lt;span class="n">dev&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">nvidiactl&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>We haven&amp;rsquo;t installed drivers yet, so nvidia-smi is not available.&lt;/p>
&lt;h3 id="install-gpu-driver">Install GPU Driver
&lt;/h3>&lt;p>Important: you should use the same driver version as the host (&lt;code>575.57.08&lt;/code> in my case).&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">wget &amp;lt;driver-runfile-url&amp;gt; -O driver.run
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">chmod +x driver.run
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">driver.run --no-kernel-modules
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm driver.run
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Just install as normal.&lt;/p>
&lt;p>Now you should be able to use &lt;code>nvidia-smi&lt;/code> and see the GPUs you added to the CT (8 GPUs in my case).&lt;/p>
&lt;h3 id="install-cuda">Install CUDA
&lt;/h3>&lt;p>Important: current driver version MUST be greater than (or equal to) the driver required by CUDA. For example, CUDA 12.9.0 will work on my machine because CUDA 12.9.0 requires &lt;code>575.00&lt;/code>, and my current driver version is &lt;code>575.57.08&lt;/code> (greater than &lt;code>575.00&lt;/code>).&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">wget &amp;lt;cuda-runfile-url&amp;gt; -O cuda.run
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">chmod +x cuda.run
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">cuda.run
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm cuda.run
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Remember to deselect the driver (we already installed the correct driver):&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl">┌──────────────────────────────────────────────────────────────────────────────┐
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ CUDA Installer │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ - [ ] Driver &amp;lt;== deselect this │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ [ ] 575.51.03 &amp;lt;== deselect this │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ + [X] CUDA Toolkit 12.9 │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ [ ] CUDA Demo Suite 12.9 &amp;lt;== deselect this (not useful, takes up space) │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ [ ] CUDA Documentation 12.9 &amp;lt;== deselect this (not useful, takes up space) │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ - [ ] Kernel Objects │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ [ ] nvidia-fs │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ Options │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ Install │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ Up/Down: Move | Left/Right: Expand | &amp;#39;Enter&amp;#39;: Select | &amp;#39;A&amp;#39;: Advanced options │
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">└──────────────────────────────────────────────────────────────────────────────┘
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>After CUDA installation, configure &lt;code>PATH&lt;/code> and &lt;code>LD_LIBRARY_PATH&lt;/code> per printed instructions.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl">... (omitted)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Please make sure that
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> - PATH includes /usr/local/cuda-12.9/bin
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> - LD_LIBRARY_PATH includes /usr/local/cuda-12.9/lib64, or, add /usr/local/cuda-12.9/lib64 to /etc/ld.so.conf and run ldconfig as root
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">... (omitted)
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Note that you can use &lt;code>/usr/local/cuda&lt;/code> instead of &lt;code>/usr/local/cuda-XX.X&lt;/code> so it&amp;rsquo;s independent of CUDA versions.&lt;/p>
&lt;p>Also add &lt;code>export CUDA_HOME=/usr/local/cuda&lt;/code> to your shell rc file.&lt;/p>
&lt;p>nvcc should be available after a shell reload:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-gdscript3" data-lang="gdscript3">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># nvcc -V&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">nvcc&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="n">NVIDIA&lt;/span> &lt;span class="p">(&lt;/span>&lt;span class="n">R&lt;/span>&lt;span class="p">)&lt;/span> &lt;span class="n">Cuda&lt;/span> &lt;span class="n">compiler&lt;/span> &lt;span class="n">driver&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">Copyright&lt;/span> &lt;span class="p">(&lt;/span>&lt;span class="n">c&lt;/span>&lt;span class="p">)&lt;/span> &lt;span class="mi">2005&lt;/span>&lt;span class="o">-&lt;/span>&lt;span class="mi">2025&lt;/span> &lt;span class="n">NVIDIA&lt;/span> &lt;span class="n">Corporation&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">Built&lt;/span> &lt;span class="n">on&lt;/span> &lt;span class="n">Wed_Apr__9_19&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">24&lt;/span>&lt;span class="p">:&lt;/span>&lt;span class="mi">57&lt;/span>&lt;span class="n">_PDT_2025&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">Cuda&lt;/span> &lt;span class="n">compilation&lt;/span> &lt;span class="n">tools&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">release&lt;/span> &lt;span class="mf">12.9&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">V12&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="mf">9.41&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">Build&lt;/span> &lt;span class="n">cuda_12&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="mf">9.&lt;/span>&lt;span class="n">r12&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="mi">9&lt;/span>&lt;span class="o">/&lt;/span>&lt;span class="n">compiler&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="mi">35813241&lt;/span>&lt;span class="n">_0&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="install-nccl">Install NCCL
&lt;/h3>&lt;p>You will need NCCL for most GPU-related communications.&lt;/p>
&lt;p>You should find a NCCL that&amp;rsquo;s compatible with your CUDA version. For example, NCCL &lt;code>2.27.3&lt;/code> is compatible with my CUDA version &lt;code>12.9&lt;/code>.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Download NCCL package&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">wget https://xxx/nccl_2.27.3-1+cuda12.9_x86_64.txz
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">tar Jxf nccl_2.27.3-1+cuda12.9_x86_64.txz
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Set some variables&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nv">NCCL_VERSION&lt;/span>&lt;span class="o">=&lt;/span>2.27
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">mkdir -p /usr/local/nccl-&lt;span class="nv">$NCCL_VERSION&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">cp -vRf nccl_2.27.3-1+cuda12.9_x86_64/* /usr/local/nccl-&lt;span class="nv">$NCCL_VERSION&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm -rf nccl_2.27.3-1+cuda12.9_x86_64
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ln -s /usr/local/nccl-&lt;span class="nv">$NCCL_VERSION&lt;/span> /usr/local/nccl
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">echo&lt;/span> &lt;span class="s2">&amp;#34;/usr/local/nccl/lib&amp;#34;&lt;/span> &amp;gt;&amp;gt;/etc/ld.so.conf
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ldconfig
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ln -s /usr/local/nccl/include/nccl.h /usr/local/include/nccl.h
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Remove NCCL package&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm https://xxx/nccl_2.27.3-1+cuda12.9_x86_64.txz
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Also add &lt;code>export NCCL_HOME=/usr/local/nccl&lt;/code> in your shell rc file,&lt;/p>
&lt;h3 id="install-nvidia-container-toolkit">Install NVIDIA Container Toolkit
&lt;/h3>&lt;p>To run Docker containers with GPUs.&lt;/p>
&lt;p>Note that the URLs below are mirrors in China. You can use original URL if you prefer.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">curl -fsSL https://mirrors.ustc.edu.cn/libnvidia-container/gpgkey &lt;span class="p">|&lt;/span> sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">curl -s -L https://mirrors.ustc.edu.cn/libnvidia-container/stable/deb/nvidia-container-toolkit.list &lt;span class="p">|&lt;/span> &lt;span class="se">\
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="se">&lt;/span> sed &lt;span class="s1">&amp;#39;s#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g&amp;#39;&lt;/span> &lt;span class="p">|&lt;/span> &lt;span class="se">\
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="se">&lt;/span> tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">sed -i &lt;span class="s1">&amp;#39;s/nvidia.github.io/mirrors.ustc.edu.cn/g&amp;#39;&lt;/span> /etc/apt/sources.list.d/nvidia-container-toolkit.list
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">apt-get update
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">apt-get install -y nvidia-container-toolkit
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Configure Docker and Containerd to use NVIDIA Container Toolkit&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">nvidia-ctk runtime configure --runtime&lt;span class="o">=&lt;/span>docker
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">nvidia-ctk runtime configure --runtime&lt;span class="o">=&lt;/span>containerd
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Since we are running inside unprivileged containers, we need to set &lt;code>no-cgroups&lt;/code> to true&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">nvidia-ctk config --set nvidia-container-cli.no-cgroups --in-place
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="install-nvidia-nsight-systems">Install NVIDIA Nsight Systems
&lt;/h3>&lt;p>So we can profile applications running on the GPU.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl">wget https://xxx/NsightSystems-linux-cli-public-2025.3.1.90-3582212.deb
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">dpkg -i NsightSystems-linux-cli-public-2025.3.1.90-3582212.deb
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm -f NsightSystems-linux-cli-public-2025.3.1.90-3582212.deb
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="functionality-tests">Functionality Tests
&lt;/h3>&lt;h4 id="nccl">NCCL
&lt;/h4>&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">git clone https://github.com/NVIDIA/nccl-tests.git
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> nccl-tests
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">git reset --hard 903918f &lt;span class="c1"># I only tested this commit.&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">make
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>P2P ON: &lt;code>NCCL_P2P_LEVEL=sys ./build/all_reduce_perf --minbytes 8 --maxbytes 128M --stepfactor 2 --ngpus 8&lt;/code> (change &lt;code>--ngpus&lt;/code> accordingly)&lt;/p>
&lt;p>P2P OFF: &lt;code>NCCL_P2P_DISABLE=1 ./build/all_reduce_perf --minbytes 8 --maxbytes 128M --stepfactor 2 --ngpus 8&lt;/code> (change &lt;code>--ngpus&lt;/code> accordingly)&lt;/p>
&lt;p>You should see a bandwidth increase after P2P is on.&lt;/p>
&lt;h4 id="cuda-p2p">CUDA P2P
&lt;/h4>&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">git clone https://github.com/NVIDIA/cuda-samples.git
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">git reset --hard 9c688d7 &lt;span class="c1"># I only tested this commit.&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> cuda-samples/Samples/5_Domain_Specific/p2pBandwidthLatencyTest
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">make
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">./p2pBandwidthLatencyTest
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>You should see lower GPU-GPU latency, higher bandwidth if P2P is on.&lt;/p>
&lt;h3 id="prepare-for-templating">Prepare for Templating
&lt;/h3>&lt;p>Check if there are unnecessary files and remove them.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ls -l
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Remove history&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">unset&lt;/span> HISTFILE
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm .*_history
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">echo&lt;/span> -n &amp;gt;/var/log/lastlog
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">echo&lt;/span> -n &amp;gt;/var/log/wtmp
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">echo&lt;/span> -n &amp;gt;/var/log/btmp
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">journalctl --vacuum-time&lt;span class="o">=&lt;/span>1s
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rm -f /var/log/*.log
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Now, it&amp;rsquo;s ready for converting to a template. To give each student a new development container, just clone this template.&lt;/p>
&lt;h2 id="other-minor-settings">Other Minor Settings
&lt;/h2>&lt;h3 id="raid-card-write-back">RAID Card Write Back
&lt;/h3>&lt;p>To achieve maximum write speed, you can enable &lt;code>write back&lt;/code> mode on your RAID card, so data is written to cache first. This will significantly (yes, by A LOT, sometimes over 100x) improve random write speed on HDDs (SSDs are already very fast). If your RAID card has a battery, you don&amp;rsquo;t need to worry about data integrity in case a power failure.&lt;/p>
&lt;p>Write cache policy:&lt;/p>
&lt;ul>
&lt;li>&lt;code>Write Throuh&lt;/code>: no cache&lt;/li>
&lt;li>&lt;code>Write Back&lt;/code>: cached if battery backup is present on the RAID card&lt;/li>
&lt;li>&lt;code>Always Write Back&lt;/code>: always cached&lt;/li>
&lt;/ul>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm4.jpeg"
width="800"
height="600"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm4_hu_cf6cf63f2dd5b21c.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm4_hu_e57234e7f2dfb528.jpeg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm4_hu_8b6806be98b2182f.webp 800w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm4_hu_c76764e8bd8ebf46.jpeg 800w"
loading="lazy"
alt="kvm4"
class="gallery-image"
data-flex-grow="133"
data-flex-basis="320px"
>
&lt;/p>
&lt;h2 id="obstacles">Obstacles
&lt;/h2>&lt;h3 id="only-255-cores-are-recognized---x2apic">Only 255 Cores are Recognized - x2APIC
&lt;/h3>&lt;p>I noticed that I have one CPU offline. It should recognize 256 CPUs but I only have 255 CPUs.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl"># lscpu
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Architecture: x86_64
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> CPU op-mode(s): 32-bit, 64-bit
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Address sizes: 48 bits physical, 48 bits virtual
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Byte Order: Little Endian
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">CPU(s): 256
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> On-line CPU(s) list: 0-254
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Off-line CPU(s) list: 255 &amp;lt;--------------- one CPU is offline -----------
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Vendor ID: AuthenticAMD
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Model name: AMD EPYC 7763 64-Core Processor
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> CPU family: 25
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Model: 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Thread(s) per core: 2
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Core(s) per socket: 64
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Socket(s): 2
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>After some digging, I learned that I need to enable &lt;code>x2APIC&lt;/code> on both the motherboard and kernel to have more than 255 CPU cores recognized.&lt;/p>
&lt;p>In BIOS &lt;code>Local APIC Mode&lt;/code> should already be &lt;code>x2APIC&lt;/code> .&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm9.jpeg"
width="800"
height="600"
srcset="https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm9_hu_2d8789994fa6a9a2.webp 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm9_hu_21d37ab5a4ab49.jpeg 480w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm9_hu_fe3ad68b7055c380.webp 800w, https://charlie0129.github.io/blog/p/proxmox-ve-shared-gpu-installation-guide/images/kvm9_hu_7ce9a82287fa5f2a.jpeg 800w"
loading="lazy"
alt="kvm9"
class="gallery-image"
data-flex-grow="133"
data-flex-basis="320px"
>
&lt;/p>
&lt;p>Now I realized it can be because I disabled IOMMU for PCIe P2P before. It turns out that disableing IOMMU can limit the number of available logical cores to 255. The reason is that the Linux kernel disables x2APIC in this case and falls back to APIC, which can only enumerate a maximum of 255 (logical) cores.&lt;/p>
&lt;p>I will keep IOMMU disabled because I need PCIe P2P to function (I don&amp;rsquo;t want to deal with P2P with IOMMU on). Just forget about the 256th core :p.&lt;/p></description></item><item><title>RTX4090 GPUDirect P2P Unlocked!</title><link>https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/</link><pubDate>Fri, 07 Feb 2025 11:18:00 +0800</pubDate><guid>https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/</guid><description>&lt;p>If you want see the test results directly, please jump to the &lt;a class="link" href="#test-the-unlocked-performance" >Test the unlocked performance&lt;/a> section.&lt;/p>
&lt;h2 id="what-is-p2p">What is P2P?
&lt;/h2>&lt;p>From NVIDIA: GPUDirect Peer to Peer enables GPU-to-GPU copies as well as loads and stores directly over the memory fabric (PCIe, NVLink). GPUDirect Peer to Peer is supported natively by the CUDA Driver.&lt;/p>
&lt;p>&lt;img src="https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv.png"
width="3600"
height="2025"
srcset="https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_c0dea0e4133f12b3.webp 480w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_78c536aa2adfec40.jpg 480w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_4d3bc510c9644fee.webp 1024w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_b69160a21f35f725.jpg 1024w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_bef5fc61dedcef4f.webp 1536w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_a015670e0b55601d.jpg 1536w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_6728d4acb2c526d3.webp 2048w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_62160f0ea9bc456b.jpg 2048w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_8da13b08935e1240.webp 2560w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_885a0dd0b0e33832.jpg 2560w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_9989f9783603442a.webp 3600w, https://charlie0129.github.io/blog/p/rtx4090-p2p-unlocked/images/gpudirect-p2p-nv_hu_316c8d5ffa418cbb.jpg 3600w"
loading="lazy"
alt="GPUDirect P2P"
class="gallery-image"
data-flex-grow="177"
data-flex-basis="426px"
>
&lt;/p>
&lt;p>As you can see, GPUDirect P2P allows for direct memory access between GPUs, bypassing the CPU and system memory. This can lead to significant performance improvements in multi-GPU systems. For example, in a multi-GPU LLM inference system, the data can be directly transferred between GPUs without involving the CPU, reducing latency and improving throughput.&lt;/p>
&lt;h2 id="why-is-p2p-disabled-on-rtx4090">Why is P2P disabled on RTX4090?
&lt;/h2>&lt;p>Easy, NVIDIA wants to make money. They want you to buy the more expensive Tesla GPUs if you want P2P.&lt;/p>
&lt;h2 id="test-machine-configuration">Test machine configuration
&lt;/h2>&lt;ul>
&lt;li>CPU: 2 x AMD EPYC 7542 (32C 64T, 225W TDP, 2.9GHz base, 3.4GHz boost)&lt;/li>
&lt;li>MEM: 2 x 8 x 32GB 3200MT/s DDR4 ECC&lt;/li>
&lt;li>GPU: 8 x NVIDIA GeForce RTX 4090 (24GB GDDR6X, 450W TDP)&lt;/li>
&lt;/ul>
&lt;p>Topology (ideally, the GPUs should be behind a PCIe switch, but our test machine doesn&amp;rsquo;t have one):&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;span class="lnt">24
&lt;/span>&lt;span class="lnt">25
&lt;/span>&lt;span class="lnt">26
&lt;/span>&lt;span class="lnt">27
&lt;/span>&lt;span class="lnt">28
&lt;/span>&lt;span class="lnt">29
&lt;/span>&lt;span class="lnt">30
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl"> GPU0 GPU1 GPU2 GPU3 GPU4 GPU5 GPU6 GPU7 NIC0 NIC1 NIC2 NIC3 CPU Affinity NUMA Affinity GPU NUMA ID
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">GPU0 X SYS SYS SYS SYS SYS SYS SYS SYS SYS SYS SYS 24-31,88-95 3 N/A
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">GPU1 SYS X SYS SYS SYS SYS SYS SYS SYS SYS SYS SYS 16-23,80-87 2 N/A
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">GPU2 SYS SYS X SYS SYS SYS SYS SYS SYS SYS SYS SYS 8-15,72-79 1 N/A
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">GPU3 SYS SYS SYS X SYS SYS SYS SYS SYS SYS SYS SYS 0-7,64-71 0 N/A
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">GPU4 SYS SYS SYS SYS X SYS SYS SYS SYS SYS SYS SYS 56-63,120-127 7 N/A
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">GPU5 SYS SYS SYS SYS SYS X SYS SYS SYS SYS SYS SYS 48-55,112-119 6 N/A
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">GPU6 SYS SYS SYS SYS SYS SYS X SYS PHB PHB PHB PHB 40-47,104-111 5 N/A
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">GPU7 SYS SYS SYS SYS SYS SYS SYS X SYS SYS SYS SYS 32-39,96-103 4 N/A
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">NIC0 SYS SYS SYS SYS SYS SYS PHB SYS X PIX PHB PHB
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">NIC1 SYS SYS SYS SYS SYS SYS PHB SYS PIX X PHB PHB
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">NIC2 SYS SYS SYS SYS SYS SYS PHB SYS PHB PHB X PIX
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">NIC3 SYS SYS SYS SYS SYS SYS PHB SYS PHB PHB PIX X
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Legend:
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> X = Self
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> SYS = Connection traversing PCIe as well as the SMP interconnect between NUMA nodes (e.g., QPI/UPI)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> NODE = Connection traversing PCIe as well as the interconnect between PCIe Host Bridges within a NUMA node
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> PHB = Connection traversing PCIe as well as a PCIe Host Bridge (typically the CPU)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> PXB = Connection traversing multiple PCIe bridges (without traversing the PCIe Host Bridge)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> PIX = Connection traversing at most a single PCIe bridge
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> NV# = Connection traversing a bonded set of # NVLinks
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">NIC Legend:
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> NIC0: mlx5_0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> NIC1: mlx5_1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> NIC2: mlx5_2
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> NIC3: mlx5_3
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h2 id="test-the-original-performance">Test the original performance
&lt;/h2>&lt;h3 id="pci-bar">PCI BAR
&lt;/h3>&lt;p>Only 256MB of BAR memory is available. Note that I did enabled Resizable BAR in the BIOS (not my fault).&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> nvidia-smi -q &lt;span class="p">|&lt;/span> grep -i bar -A &lt;span class="m">3&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> BAR1 Memory Usage
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> Total : 256 MiB
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> Used : 1 MiB
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> Free : 255 MiB
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="nccl-tests">NCCL Tests
&lt;/h3>&lt;p>Building NCCL Tests&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">git clone --depth&lt;span class="o">=&lt;/span>&lt;span class="m">1&lt;/span> https://github.com/NVIDIA/nccl-tests.git
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> nccl-tests
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">make -j&lt;span class="k">$(&lt;/span>nproc&lt;span class="k">)&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Runnning:&lt;/p>
&lt;ul>
&lt;li>Around 14.5GB/s of bandwidth.&lt;/li>
&lt;/ul>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;span class="lnt">24
&lt;/span>&lt;span class="lnt">25
&lt;/span>&lt;span class="lnt">26
&lt;/span>&lt;span class="lnt">27
&lt;/span>&lt;span class="lnt">28
&lt;/span>&lt;span class="lnt">29
&lt;/span>&lt;span class="lnt">30
&lt;/span>&lt;span class="lnt">31
&lt;/span>&lt;span class="lnt">32
&lt;/span>&lt;span class="lnt">33
&lt;/span>&lt;span class="lnt">34
&lt;/span>&lt;span class="lnt">35
&lt;/span>&lt;span class="lnt">36
&lt;/span>&lt;span class="lnt">37
&lt;/span>&lt;span class="lnt">38
&lt;/span>&lt;span class="lnt">39
&lt;/span>&lt;span class="lnt">40
&lt;/span>&lt;span class="lnt">41
&lt;/span>&lt;span class="lnt">42
&lt;/span>&lt;span class="lnt">43
&lt;/span>&lt;span class="lnt">44
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> ./build/all_reduce_perf -b &lt;span class="m">8&lt;/span> -e 128M -f &lt;span class="m">2&lt;/span> -g &lt;span class="m">8&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> nThread &lt;span class="m">1&lt;/span> nGpus &lt;span class="m">8&lt;/span> minBytes &lt;span class="m">8&lt;/span> maxBytes &lt;span class="m">134217728&lt;/span> step: 2&lt;span class="o">(&lt;/span>factor&lt;span class="o">)&lt;/span> warmup iters: &lt;span class="m">5&lt;/span> iters: &lt;span class="m">20&lt;/span> agg iters: &lt;span class="m">1&lt;/span> validation: &lt;span class="m">1&lt;/span> graph: &lt;span class="m">0&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Using devices&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> Rank &lt;span class="m">0&lt;/span> Group &lt;span class="m">0&lt;/span> Pid &lt;span class="m">1756513&lt;/span> on &amp;lt;REDACTED&amp;gt; device &lt;span class="m">0&lt;/span> &lt;span class="o">[&lt;/span>0x01&lt;span class="o">]&lt;/span> NVIDIA GeForce RTX &lt;span class="m">4090&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> Rank &lt;span class="m">1&lt;/span> Group &lt;span class="m">0&lt;/span> Pid &lt;span class="m">1756513&lt;/span> on &amp;lt;REDACTED&amp;gt; device &lt;span class="m">1&lt;/span> &lt;span class="o">[&lt;/span>0x25&lt;span class="o">]&lt;/span> NVIDIA GeForce RTX &lt;span class="m">4090&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> Rank &lt;span class="m">2&lt;/span> Group &lt;span class="m">0&lt;/span> Pid &lt;span class="m">1756513&lt;/span> on &amp;lt;REDACTED&amp;gt; device &lt;span class="m">2&lt;/span> &lt;span class="o">[&lt;/span>0x41&lt;span class="o">]&lt;/span> NVIDIA GeForce RTX &lt;span class="m">4090&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> Rank &lt;span class="m">3&lt;/span> Group &lt;span class="m">0&lt;/span> Pid &lt;span class="m">1756513&lt;/span> on &amp;lt;REDACTED&amp;gt; device &lt;span class="m">3&lt;/span> &lt;span class="o">[&lt;/span>0x61&lt;span class="o">]&lt;/span> NVIDIA GeForce RTX &lt;span class="m">4090&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> Rank &lt;span class="m">4&lt;/span> Group &lt;span class="m">0&lt;/span> Pid &lt;span class="m">1756513&lt;/span> on &amp;lt;REDACTED&amp;gt; device &lt;span class="m">4&lt;/span> &lt;span class="o">[&lt;/span>0x81&lt;span class="o">]&lt;/span> NVIDIA GeForce RTX &lt;span class="m">4090&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> Rank &lt;span class="m">5&lt;/span> Group &lt;span class="m">0&lt;/span> Pid &lt;span class="m">1756513&lt;/span> on &amp;lt;REDACTED&amp;gt; device &lt;span class="m">5&lt;/span> &lt;span class="o">[&lt;/span>0xa1&lt;span class="o">]&lt;/span> NVIDIA GeForce RTX &lt;span class="m">4090&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> Rank &lt;span class="m">6&lt;/span> Group &lt;span class="m">0&lt;/span> Pid &lt;span class="m">1756513&lt;/span> on &amp;lt;REDACTED&amp;gt; device &lt;span class="m">6&lt;/span> &lt;span class="o">[&lt;/span>0xc1&lt;span class="o">]&lt;/span> NVIDIA GeForce RTX &lt;span class="m">4090&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> Rank &lt;span class="m">7&lt;/span> Group &lt;span class="m">0&lt;/span> Pid &lt;span class="m">1756513&lt;/span> on &amp;lt;REDACTED&amp;gt; device &lt;span class="m">7&lt;/span> &lt;span class="o">[&lt;/span>0xe1&lt;span class="o">]&lt;/span> NVIDIA GeForce RTX &lt;span class="m">4090&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># out-of-place in-place &lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> size count &lt;span class="nb">type&lt;/span> redop root &lt;span class="nb">time&lt;/span> algbw busbw &lt;span class="c1">#wrong time algbw busbw #wrong&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> &lt;span class="o">(&lt;/span>B&lt;span class="o">)&lt;/span> &lt;span class="o">(&lt;/span>elements&lt;span class="o">)&lt;/span> &lt;span class="o">(&lt;/span>us&lt;span class="o">)&lt;/span> &lt;span class="o">(&lt;/span>GB/s&lt;span class="o">)&lt;/span> &lt;span class="o">(&lt;/span>GB/s&lt;span class="o">)&lt;/span> &lt;span class="o">(&lt;/span>us&lt;span class="o">)&lt;/span> &lt;span class="o">(&lt;/span>GB/s&lt;span class="o">)&lt;/span> &lt;span class="o">(&lt;/span>GB/s&lt;span class="o">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 8 2 float sum -1 38.83 0.00 0.00 0 40.43 0.00 0.00 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 16 4 float sum -1 38.73 0.00 0.00 0 38.59 0.00 0.00 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 32 8 float sum -1 41.85 0.00 0.00 0 42.55 0.00 0.00 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 64 16 float sum -1 42.55 0.00 0.00 0 42.65 0.00 0.00 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 128 32 float sum -1 42.42 0.00 0.01 0 42.88 0.00 0.01 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 256 64 float sum -1 42.44 0.01 0.01 0 42.53 0.01 0.01 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 512 128 float sum -1 42.58 0.01 0.02 0 42.68 0.01 0.02 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1024 256 float sum -1 44.04 0.02 0.04 0 42.39 0.02 0.04 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2048 512 float sum -1 42.91 0.05 0.08 0 42.61 0.05 0.08 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4096 1024 float sum -1 43.18 0.09 0.17 0 42.69 0.10 0.17 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 8192 2048 float sum -1 44.02 0.19 0.33 0 42.96 0.19 0.33 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 16384 4096 float sum -1 43.10 0.38 0.67 0 42.99 0.38 0.67 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 32768 8192 float sum -1 44.18 0.74 1.30 0 43.63 0.75 1.31 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 65536 16384 float sum -1 45.66 1.44 2.51 0 45.28 1.45 2.53 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 131072 32768 float sum -1 67.27 1.95 3.41 0 54.86 2.39 4.18 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 262144 65536 float sum -1 124.8 2.10 3.68 0 121.1 2.17 3.79 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 524288 131072 float sum -1 196.9 2.66 4.66 0 200.5 2.61 4.58 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1048576 262144 float sum -1 222.8 4.71 8.24 0 226.1 4.64 8.12 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2097152 524288 float sum -1 373.4 5.62 9.83 0 358.6 5.85 10.23 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4194304 1048576 float sum -1 580.8 7.22 12.64 0 592.0 7.09 12.40 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 8388608 2097152 float sum -1 1041.8 8.05 14.09 0 1040.2 8.06 14.11 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 16777216 4194304 float sum -1 1972.8 8.50 14.88 0 1979.5 8.48 14.83 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 33554432 8388608 float sum -1 3905.6 8.59 15.04 0 3919.0 8.56 14.98 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 67108864 16777216 float sum -1 7907.1 8.49 14.85 0 7905.3 8.49 14.86 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 134217728 33554432 float sum -1 16253 8.26 14.45 0 16227 8.27 14.47 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">&lt;/span>&lt;span class="gp">#&lt;/span> Out of bounds values : &lt;span class="m">0&lt;/span> OK
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> Avg bus bandwidth : 4.85265
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="p2p-bandwidth-and-latency">P2P Bandwidth and Latency
&lt;/h3>&lt;p>Building:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">git clone --depth&lt;span class="o">=&lt;/span>&lt;span class="m">1&lt;/span> https://github.com/NVIDIA/cuda-samples.git
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> cuda-samples/Samples/5_Domain_Specific/p2pBandwidthLatencyTest
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">make -j&lt;span class="k">$(&lt;/span>nproc&lt;span class="k">)&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Running:&lt;/p>
&lt;ul>
&lt;li>About 21GB/s bidirectional bandwidth&lt;/li>
&lt;li>10us+ GPU-GPU latency&lt;/li>
&lt;/ul>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;span class="lnt">24
&lt;/span>&lt;span class="lnt">25
&lt;/span>&lt;span class="lnt">26
&lt;/span>&lt;span class="lnt">27
&lt;/span>&lt;span class="lnt">28
&lt;/span>&lt;span class="lnt">29
&lt;/span>&lt;span class="lnt">30
&lt;/span>&lt;span class="lnt">31
&lt;/span>&lt;span class="lnt">32
&lt;/span>&lt;span class="lnt">33
&lt;/span>&lt;span class="lnt">34
&lt;/span>&lt;span class="lnt">35
&lt;/span>&lt;span class="lnt">36
&lt;/span>&lt;span class="lnt">37
&lt;/span>&lt;span class="lnt">38
&lt;/span>&lt;span class="lnt">39
&lt;/span>&lt;span class="lnt">40
&lt;/span>&lt;span class="lnt">41
&lt;/span>&lt;span class="lnt">42
&lt;/span>&lt;span class="lnt">43
&lt;/span>&lt;span class="lnt">44
&lt;/span>&lt;span class="lnt">45
&lt;/span>&lt;span class="lnt">46
&lt;/span>&lt;span class="lnt">47
&lt;/span>&lt;span class="lnt">48
&lt;/span>&lt;span class="lnt">49
&lt;/span>&lt;span class="lnt">50
&lt;/span>&lt;span class="lnt">51
&lt;/span>&lt;span class="lnt">52
&lt;/span>&lt;span class="lnt">53
&lt;/span>&lt;span class="lnt">54
&lt;/span>&lt;span class="lnt">55
&lt;/span>&lt;span class="lnt">56
&lt;/span>&lt;span class="lnt">57
&lt;/span>&lt;span class="lnt">58
&lt;/span>&lt;span class="lnt">59
&lt;/span>&lt;span class="lnt">60
&lt;/span>&lt;span class="lnt">61
&lt;/span>&lt;span class="lnt">62
&lt;/span>&lt;span class="lnt">63
&lt;/span>&lt;span class="lnt">64
&lt;/span>&lt;span class="lnt">65
&lt;/span>&lt;span class="lnt">66
&lt;/span>&lt;span class="lnt">67
&lt;/span>&lt;span class="lnt">68
&lt;/span>&lt;span class="lnt">69
&lt;/span>&lt;span class="lnt">70
&lt;/span>&lt;span class="lnt">71
&lt;/span>&lt;span class="lnt">72
&lt;/span>&lt;span class="lnt">73
&lt;/span>&lt;span class="lnt">74
&lt;/span>&lt;span class="lnt">75
&lt;/span>&lt;span class="lnt">76
&lt;/span>&lt;span class="lnt">77
&lt;/span>&lt;span class="lnt">78
&lt;/span>&lt;span class="lnt">79
&lt;/span>&lt;span class="lnt">80
&lt;/span>&lt;span class="lnt">81
&lt;/span>&lt;span class="lnt">82
&lt;/span>&lt;span class="lnt">83
&lt;/span>&lt;span class="lnt">84
&lt;/span>&lt;span class="lnt">85
&lt;/span>&lt;span class="lnt">86
&lt;/span>&lt;span class="lnt">87
&lt;/span>&lt;span class="lnt">88
&lt;/span>&lt;span class="lnt">89
&lt;/span>&lt;span class="lnt">90
&lt;/span>&lt;span class="lnt">91
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> ./p2pBandwidthLatencyTest
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">P2P Connectivity Matrix
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 0 1 0 0 0 0 0 0 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1 0 1 0 0 0 0 0 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2 0 0 1 0 0 0 0 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 3 0 0 0 1 0 0 0 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4 0 0 0 0 1 0 0 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 5 0 0 0 0 0 1 0 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 6 0 0 0 0 0 0 1 0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 7 0 0 0 0 0 0 0 1
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">Unidirectional P2P=Disabled Bandwidth Matrix (GB/s)
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 0 909.49 18.77 19.56 20.23 18.72 19.29 19.34 19.83
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1 19.95 919.12 18.93 20.18 18.83 19.23 19.24 19.80
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2 19.87 19.55 919.66 20.27 18.82 19.28 19.29 19.77
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 3 19.92 19.48 19.56 918.58 18.82 19.23 19.19 19.80
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4 19.88 20.58 19.74 20.54 920.15 18.38 18.89 18.71
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 5 20.04 20.19 19.80 20.37 18.75 921.29 18.88 19.08
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 6 20.04 20.11 19.71 20.60 18.77 18.58 920.74 18.62
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 7 20.02 20.21 19.73 20.33 18.37 18.74 18.89 921.29
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">Unidirectional P2P=Enabled Bandwidth (P2P Writes) Matrix (GB/s)
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 0 910.02 18.83 19.55 20.27 18.76 19.36 19.26 19.83
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1 19.95 920.20 18.92 20.19 18.83 19.26 19.21 19.80
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2 19.82 19.61 919.66 20.28 18.86 19.29 19.34 19.75
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 3 19.91 19.47 19.60 920.20 18.83 19.26 19.16 19.81
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4 19.78 20.43 19.75 20.56 920.25 18.60 18.85 18.75
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 5 20.02 20.24 19.76 20.45 18.80 922.37 18.89 19.15
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 6 20.06 20.12 19.75 20.59 18.80 18.58 921.25 18.61
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 7 20.02 20.16 19.80 20.38 18.41 18.72 18.87 920.83
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">Bidirectional P2P=Disabled Bandwidth Matrix (GB/s)
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 0 916.15 21.03 21.53 21.54 20.69 21.02 21.10 21.06
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1 21.39 920.74 21.59 21.52 20.55 21.02 20.50 21.18
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2 21.15 21.48 921.83 21.20 20.58 21.11 20.98 21.09
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 3 21.38 21.67 21.42 922.65 20.53 21.05 20.65 21.21
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4 20.86 20.89 20.86 20.95 923.69 19.99 20.11 19.97
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 5 20.90 20.97 21.00 21.02 20.22 922.10 20.15 20.30
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 6 20.94 20.62 20.89 20.61 19.98 20.07 923.11 19.99
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 7 21.07 21.13 21.10 21.22 20.00 20.29 20.11 923.46
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">Bidirectional P2P=Enabled Bandwidth Matrix (GB/s)
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 0 917.23 20.86 21.49 21.56 20.63 20.99 21.05 21.13
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1 21.30 922.37 21.61 21.56 20.53 21.08 20.49 21.15
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2 21.15 21.47 922.36 21.16 20.50 21.06 20.94 21.10
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 3 21.39 21.60 21.39 922.92 20.63 21.09 20.69 21.22
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4 20.89 20.86 20.81 20.89 923.46 20.12 20.05 20.02
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 5 20.88 20.98 20.99 20.87 20.20 923.65 20.12 20.39
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 6 21.05 20.63 20.89 20.67 20.07 20.05 922.92 20.02
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 7 21.01 21.12 21.06 21.19 20.01 20.31 20.13 923.16
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">P2P=Disabled Latency Matrix (us)
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> GPU 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 0 1.54 20.26 11.68 11.60 12.65 15.80 12.19 11.75
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1 11.60 1.48 11.58 11.66 16.03 12.13 12.55 14.59
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2 20.27 11.59 1.43 20.08 13.17 17.14 16.31 11.41
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 3 11.50 11.59 11.51 1.47 13.11 16.14 14.04 11.61
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4 12.53 14.27 12.75 12.65 1.51 12.47 12.49 12.41
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 5 11.88 11.73 11.65 11.63 12.28 1.42 14.95 15.40
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 6 12.27 12.63 12.42 12.68 12.25 12.30 1.47 11.89
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 7 11.46 16.67 11.44 11.47 12.30 13.33 13.57 1.41
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="go"> CPU 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 0 4.04 12.23 10.01 9.91 10.88 10.78 10.60 11.29
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1 9.79 3.15 9.85 10.06 10.77 10.56 10.50 10.48
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2 10.04 9.63 3.24 9.94 10.86 10.65 10.70 10.63
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 3 9.75 9.61 9.85 3.26 10.92 10.82 10.77 10.67
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4 10.50 10.26 10.61 10.56 3.57 11.55 11.48 11.26
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 5 10.52 10.07 10.40 10.48 11.42 3.52 11.32 11.24
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 6 10.24 10.20 10.44 10.47 11.42 11.29 3.54 11.35
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 7 10.26 10.09 10.50 10.41 11.47 11.31 11.36 3.53
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">P2P=Enabled Latency (P2P Writes) Matrix (us)
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> GPU 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 0 1.54 11.67 11.75 20.27 14.49 15.77 16.95 15.91
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1 11.67 1.48 11.44 11.59 15.22 12.17 13.20 13.18
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2 11.58 20.27 1.43 11.50 14.60 13.73 13.21 11.38
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 3 11.58 20.06 12.12 1.47 13.16 16.17 14.67 11.67
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4 12.88 12.78 13.92 12.58 1.50 12.46 12.59 12.50
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 5 11.48 11.93 11.78 11.88 19.18 1.42 11.59 11.40
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 6 11.95 11.70 14.90 14.00 12.42 11.41 1.46 11.63
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 7 12.96 11.45 11.60 11.53 20.55 11.32 12.94 1.40
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="go"> CPU 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 0 3.21 9.61 9.86 9.79 10.69 10.48 10.55 10.44
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 1 9.67 3.12 9.81 9.81 10.64 10.46 10.66 10.43
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 2 9.89 9.62 3.20 9.98 10.96 10.67 10.75 10.72
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 3 9.80 9.65 9.89 3.20 10.86 10.78 10.78 10.61
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 4 10.41 10.24 10.60 10.50 3.52 11.34 11.49 11.28
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 5 10.27 10.14 11.93 14.06 14.53 4.55 16.99 19.67
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 6 20.68 20.61 20.39 20.63 20.86 14.35 5.21 14.46
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> 7 9.89 9.66 9.85 9.85 10.81 10.62 10.68 3.41
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h2 id="how-to-unlock-p2p-on-rtx4090">How to unlock P2P on RTX4090?
&lt;/h2>&lt;p>I encountered this legendary &lt;a class="link" href="https://github.com/tinygrad/open-gpu-kernel-modules" target="_blank" rel="noopener"
>modified NVIDIA driver&lt;/a> by tinygrad that unlocks P2P on RTX4090 GPUs which blows my mind. Let&amp;rsquo;s give it a try!&lt;/p>
&lt;h3 id="disable-iommu">Disable IOMMU
&lt;/h3>&lt;p>If the following command returns an empty list, it means that the IOMMU is disabled, otherwise, you need to disable it. Consult your motherboard manual on how to disable IOMMU.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">ll /sys/class/iommu/
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="enable-resizable-bar">Enable Resizable BAR
&lt;/h3>&lt;p>Enable Resizable BAR in the BIOS. It&amp;rsquo;s required for the modified NVIDIA driver to work. Consult your motherboard manual on how to enable Resizable BAR.&lt;/p>
&lt;h3 id="uninstall-the-official-nvidia-driver">Uninstall the official NVIDIA driver
&lt;/h3>&lt;p>We will install our own modified NVIDIA driver, so we need to uninstall the official NVIDIA driver first.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">nvidia-uninstall
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">reboot
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="install-the-official-nvidia-driver-without-kernel-modules">Install the official NVIDIA driver without kernel modules
&lt;/h3>&lt;p>Visit the &lt;a class="link" href="https://github.com/tinygrad/open-gpu-kernel-modules" target="_blank" rel="noopener"
>modified NVIDIA driver&lt;/a> by tinygrad. Check out the branches with p2p in the name. There are multiple versions. You should choose one that fits. For example, I am using the &lt;a class="link" href="https://github.com/tinygrad/open-gpu-kernel-modules/tree/550.90.07-p2p" target="_blank" rel="noopener"
>550.90.07-p2p&lt;/a> branch. Remember the version number &lt;code>550.90.07&lt;/code>, you will need it later.&lt;/p>
&lt;p>Download the official driver with the same version number as you chose (&lt;code>550.90.07&lt;/code> in my case) from the &lt;a class="link" href="https://www.nvidia.com/Download/index.aspx" target="_blank" rel="noopener"
>NVIDIA website&lt;/a>. The driver I downloaded is &lt;code>NVIDIA-Linux-x86_64-550.90.07.run&lt;/code>.&lt;/p>
&lt;p>Install the official driver without the kernel modules because we will install our own modified kernel modules later.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="go">./NVIDIA-Linux-x86_64-550.90.07.run --no-kernel-modules
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="install-the-modified-kernel-modules">Install the modified kernel modules
&lt;/h3>&lt;p>Clone the modified NVIDIA driver by tinygrad and install. Remember to replace the branch name with the one you chose.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;span class="lnt">9
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">git clone --depth&lt;span class="o">=&lt;/span>&lt;span class="m">1&lt;/span> -b 550.90.07-p2p https://github.com/tinygrad/open-gpu-kernel-modules.git
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd&lt;/span> open-gpu-kernel-modules
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Just in case&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">rmmod nvidia_drm nvidia_modeset nvidia_uvm nvidia
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Build and install the modified kernel modules&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">make modules -j&lt;span class="k">$(&lt;/span>nproc&lt;span class="k">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">make modules_install
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">depmod
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">nvidia-smi -pm &lt;span class="m">1&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h2 id="test-the-unlocked-performance">Test the unlocked performance
&lt;/h2>&lt;h3 id="pci-bar-1">PCI BAR
&lt;/h3>&lt;p>Now the &lt;strong>BAR memory is fully available&lt;/strong>.&lt;/p>
&lt;ul>
&lt;li>256MB -&amp;gt; 32GB.&lt;/li>
&lt;/ul>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> nvidia-smi -q &lt;span class="p">|&lt;/span> grep -i bar -A &lt;span class="m">3&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> BAR1 Memory Usage
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> Total : 32768 MiB
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> Used : 24211 MiB
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go"> Free : 8557 MiB
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="nccl-tests-1">NCCL Tests
&lt;/h3>&lt;ul>
&lt;li>14.47GB/s -&amp;gt; 20.64GB/s: &lt;strong>42% improvement&lt;/strong>&lt;/li>
&lt;/ul>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;span class="lnt">24
&lt;/span>&lt;span class="lnt">25
&lt;/span>&lt;span class="lnt">26
&lt;/span>&lt;span class="lnt">27
&lt;/span>&lt;span class="lnt">28
&lt;/span>&lt;span class="lnt">29
&lt;/span>&lt;span class="lnt">30
&lt;/span>&lt;span class="lnt">31
&lt;/span>&lt;span class="lnt">32
&lt;/span>&lt;span class="lnt">33
&lt;/span>&lt;span class="lnt">34
&lt;/span>&lt;span class="lnt">35
&lt;/span>&lt;span class="lnt">36
&lt;/span>&lt;span class="lnt">37
&lt;/span>&lt;span class="lnt">38
&lt;/span>&lt;span class="lnt">39
&lt;/span>&lt;span class="lnt">40
&lt;/span>&lt;span class="lnt">41
&lt;/span>&lt;span class="lnt">42
&lt;/span>&lt;span class="lnt">43
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl"># nThread 1 nGpus 8 minBytes 8 maxBytes 134217728 step: 2(factor) warmup iters: 5 iters: 20 agg iters: 1 validation: 1 graph: 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">#
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Using devices
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Rank 0 Group 0 Pid 33895 on &amp;lt;REDACTED&amp;gt; device 0 [0x01] NVIDIA GeForce RTX 4090
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Rank 1 Group 0 Pid 33895 on &amp;lt;REDACTED&amp;gt; device 1 [0x25] NVIDIA GeForce RTX 4090
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Rank 2 Group 0 Pid 33895 on &amp;lt;REDACTED&amp;gt; device 2 [0x41] NVIDIA GeForce RTX 4090
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Rank 3 Group 0 Pid 33895 on &amp;lt;REDACTED&amp;gt; device 3 [0x61] NVIDIA GeForce RTX 4090
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Rank 4 Group 0 Pid 33895 on &amp;lt;REDACTED&amp;gt; device 4 [0x81] NVIDIA GeForce RTX 4090
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Rank 5 Group 0 Pid 33895 on &amp;lt;REDACTED&amp;gt; device 5 [0xa1] NVIDIA GeForce RTX 4090
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Rank 6 Group 0 Pid 33895 on &amp;lt;REDACTED&amp;gt; device 6 [0xc1] NVIDIA GeForce RTX 4090
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Rank 7 Group 0 Pid 33895 on &amp;lt;REDACTED&amp;gt; device 7 [0xe1] NVIDIA GeForce RTX 4090
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">#
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># out-of-place in-place
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># size count type redop root time algbw busbw #wrong time algbw busbw #wrong
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># (B) (elements) (us) (GB/s) (GB/s) (us) (GB/s) (GB/s)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 8 2 float sum -1 38.82 0.00 0.00 0 38.16 0.00 0.00 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 16 4 float sum -1 38.31 0.00 0.00 0 38.12 0.00 0.00 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 32 8 float sum -1 38.57 0.00 0.00 0 40.87 0.00 0.00 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 64 16 float sum -1 40.71 0.00 0.00 0 40.65 0.00 0.00 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 128 32 float sum -1 40.51 0.00 0.01 0 41.66 0.00 0.01 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 256 64 float sum -1 41.63 0.01 0.01 0 41.38 0.01 0.01 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 512 128 float sum -1 41.67 0.01 0.02 0 42.45 0.01 0.02 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1024 256 float sum -1 41.70 0.02 0.04 0 41.67 0.02 0.04 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2048 512 float sum -1 41.74 0.05 0.09 0 41.74 0.05 0.09 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4096 1024 float sum -1 42.35 0.10 0.17 0 42.39 0.10 0.17 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 8192 2048 float sum -1 42.14 0.19 0.34 0 41.88 0.20 0.34 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 16384 4096 float sum -1 43.19 0.38 0.66 0 42.73 0.38 0.67 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 32768 8192 float sum -1 42.17 0.78 1.36 0 42.61 0.77 1.35 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 65536 16384 float sum -1 47.58 1.38 2.41 0 46.95 1.40 2.44 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 131072 32768 float sum -1 72.03 1.82 3.18 0 71.50 1.83 3.21 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 262144 65536 float sum -1 119.7 2.19 3.83 0 118.6 2.21 3.87 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 524288 131072 float sum -1 166.6 3.15 5.51 0 159.8 3.28 5.74 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1048576 262144 float sum -1 216.1 4.85 8.49 0 217.2 4.83 8.45 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2097152 524288 float sum -1 321.5 6.52 11.42 0 322.6 6.50 11.37 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4194304 1048576 float sum -1 478.7 8.76 15.33 0 480.1 8.74 15.29 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 8388608 2097152 float sum -1 798.6 10.50 18.38 0 818.0 10.26 17.95 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 16777216 4194304 float sum -1 1472.8 11.39 19.94 0 1472.1 11.40 19.94 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 33554432 8388608 float sum -1 2870.3 11.69 20.46 0 2866.4 11.71 20.49 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 67108864 16777216 float sum -1 5705.0 11.76 20.59 0 5695.6 11.78 20.62 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 134217728 33554432 float sum -1 11382 11.79 20.64 0 11380 11.79 20.64 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Out of bounds values : 0 OK
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># Avg bus bandwidth : 6.11168
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">#
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="p2p-bandwidth-and-latency-1">P2P Bandwidth and Latency
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>P2P is now available&lt;/strong>: see the 1s in the P2P Connectivity Matrix&lt;/li>
&lt;li>Bandwidth: 21.39GB/s -&amp;gt; 50.15GB/s: &lt;strong>134% improvement&lt;/strong>&lt;/li>
&lt;li>Latency: 11.67us -&amp;gt; 1.19us: &lt;strong>89% reduction&lt;/strong>&lt;/li>
&lt;/ul>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;span class="lnt">24
&lt;/span>&lt;span class="lnt">25
&lt;/span>&lt;span class="lnt">26
&lt;/span>&lt;span class="lnt">27
&lt;/span>&lt;span class="lnt">28
&lt;/span>&lt;span class="lnt">29
&lt;/span>&lt;span class="lnt">30
&lt;/span>&lt;span class="lnt">31
&lt;/span>&lt;span class="lnt">32
&lt;/span>&lt;span class="lnt">33
&lt;/span>&lt;span class="lnt">34
&lt;/span>&lt;span class="lnt">35
&lt;/span>&lt;span class="lnt">36
&lt;/span>&lt;span class="lnt">37
&lt;/span>&lt;span class="lnt">38
&lt;/span>&lt;span class="lnt">39
&lt;/span>&lt;span class="lnt">40
&lt;/span>&lt;span class="lnt">41
&lt;/span>&lt;span class="lnt">42
&lt;/span>&lt;span class="lnt">43
&lt;/span>&lt;span class="lnt">44
&lt;/span>&lt;span class="lnt">45
&lt;/span>&lt;span class="lnt">46
&lt;/span>&lt;span class="lnt">47
&lt;/span>&lt;span class="lnt">48
&lt;/span>&lt;span class="lnt">49
&lt;/span>&lt;span class="lnt">50
&lt;/span>&lt;span class="lnt">51
&lt;/span>&lt;span class="lnt">52
&lt;/span>&lt;span class="lnt">53
&lt;/span>&lt;span class="lnt">54
&lt;/span>&lt;span class="lnt">55
&lt;/span>&lt;span class="lnt">56
&lt;/span>&lt;span class="lnt">57
&lt;/span>&lt;span class="lnt">58
&lt;/span>&lt;span class="lnt">59
&lt;/span>&lt;span class="lnt">60
&lt;/span>&lt;span class="lnt">61
&lt;/span>&lt;span class="lnt">62
&lt;/span>&lt;span class="lnt">63
&lt;/span>&lt;span class="lnt">64
&lt;/span>&lt;span class="lnt">65
&lt;/span>&lt;span class="lnt">66
&lt;/span>&lt;span class="lnt">67
&lt;/span>&lt;span class="lnt">68
&lt;/span>&lt;span class="lnt">69
&lt;/span>&lt;span class="lnt">70
&lt;/span>&lt;span class="lnt">71
&lt;/span>&lt;span class="lnt">72
&lt;/span>&lt;span class="lnt">73
&lt;/span>&lt;span class="lnt">74
&lt;/span>&lt;span class="lnt">75
&lt;/span>&lt;span class="lnt">76
&lt;/span>&lt;span class="lnt">77
&lt;/span>&lt;span class="lnt">78
&lt;/span>&lt;span class="lnt">79
&lt;/span>&lt;span class="lnt">80
&lt;/span>&lt;span class="lnt">81
&lt;/span>&lt;span class="lnt">82
&lt;/span>&lt;span class="lnt">83
&lt;/span>&lt;span class="lnt">84
&lt;/span>&lt;span class="lnt">85
&lt;/span>&lt;span class="lnt">86
&lt;/span>&lt;span class="lnt">87
&lt;/span>&lt;span class="lnt">88
&lt;/span>&lt;span class="lnt">89
&lt;/span>&lt;span class="lnt">90
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl">P2P Connectivity Matrix
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 0 1 1 1 1 1 1 1 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1 1 1 1 1 1 1 1 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2 1 1 1 1 1 1 1 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 3 1 1 1 1 1 1 1 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4 1 1 1 1 1 1 1 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 5 1 1 1 1 1 1 1 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 6 1 1 1 1 1 1 1 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 7 1 1 1 1 1 1 1 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Unidirectional P2P=Disabled Bandwidth Matrix (GB/s)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 0 912.13 18.86 19.89 20.25 18.34 19.64 19.25 19.45
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1 20.56 920.74 19.44 20.27 18.46 19.72 19.19 19.40
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2 20.36 19.72 922.37 20.28 18.52 19.65 19.22 19.40
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 3 20.43 19.68 20.04 922.49 18.47 19.59 19.15 19.41
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4 20.20 20.15 20.25 20.26 921.83 19.04 18.84 18.36
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 5 20.45 20.09 20.17 20.46 18.29 922.37 18.73 18.60
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 6 20.39 20.18 20.24 20.54 18.44 19.09 922.49 18.65
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 7 20.53 20.14 20.12 20.51 18.17 19.11 18.74 923.46
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Unidirectional P2P=Enabled Bandwidth (P2P Writes) Matrix (GB/s)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 0 913.74 25.60 25.85 25.85 21.36 22.41 21.74 22.48
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1 25.78 938.91 25.79 25.79 20.70 22.39 22.53 21.63
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2 25.70 25.95 939.00 25.78 21.42 21.59 22.21 22.16
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 3 25.60 25.93 25.53 938.42 22.14 22.30 21.70 22.45
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4 22.41 21.61 22.35 22.49 940.70 25.69 25.96 25.90
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 5 21.34 22.38 21.72 22.41 25.77 939.57 25.95 25.87
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 6 20.57 22.27 22.32 21.60 25.75 26.01 941.73 25.83
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 7 21.32 21.52 22.39 22.48 25.51 25.83 25.75 938.44
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Bidirectional P2P=Disabled Bandwidth Matrix (GB/s)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 0 918.85 20.94 21.69 21.67 20.66 21.44 20.98 21.26
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1 21.48 921.29 21.57 21.54 20.20 20.65 20.87 20.70
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2 21.34 21.63 921.56 21.13 20.66 21.28 20.89 21.21
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 3 21.40 21.72 21.62 921.83 20.16 20.92 20.89 20.89
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4 20.93 20.33 20.87 20.45 922.90 20.07 20.21 19.96
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 5 21.40 20.86 21.26 20.90 20.23 923.69 20.18 20.33
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 6 20.93 20.87 20.89 20.90 20.27 20.25 923.67 20.19
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 7 21.19 20.66 21.03 20.87 20.02 20.28 20.41 923.41
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Bidirectional P2P=Enabled Bandwidth Matrix (GB/s)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> D\D 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 0 916.45 50.10 50.46 50.29 39.90 41.85 40.83 41.68
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1 50.15 919.60 50.19 50.22 38.93 41.79 41.87 40.82
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2 49.91 50.42 920.74 50.53 40.19 40.94 41.86 41.61
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 3 50.08 50.48 50.35 919.66 40.22 41.69 40.92 41.78
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4 41.60 40.94 41.86 41.93 919.93 49.80 50.36 50.22
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 5 40.25 41.68 39.96 41.64 49.75 921.83 50.20 50.66
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 6 39.59 41.58 41.83 40.95 49.89 50.43 921.56 50.59
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 7 40.36 40.86 41.76 41.82 49.96 50.43 50.28 921.01
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">P2P=Disabled Latency Matrix (us)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> GPU 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 0 1.50 11.60 20.17 20.18 13.08 11.27 14.58 19.33
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1 11.68 1.38 11.74 20.17 12.60 11.39 14.35 14.59
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2 11.33 11.34 1.31 11.50 16.96 20.53 16.53 20.53
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 3 11.51 11.51 11.51 1.37 17.86 11.37 15.80 20.54
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4 11.47 11.79 11.44 12.57 1.38 12.24 12.93 11.73
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 5 11.48 11.79 11.64 11.64 14.40 1.44 13.46 14.35
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 6 13.59 15.05 13.35 12.52 12.06 11.67 1.40 12.34
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 7 19.32 19.95 11.39 11.44 12.87 12.23 14.05 1.38
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> CPU 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 0 3.28 10.21 10.15 9.83 10.92 10.75 10.88 10.71
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1 10.07 3.14 9.81 9.56 10.58 10.41 10.61 10.35
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2 10.13 9.68 3.28 9.62 10.71 10.56 10.73 10.48
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 3 9.81 9.46 9.68 3.13 10.60 10.41 10.52 10.35
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4 10.60 10.20 10.40 10.16 3.48 11.19 11.37 11.07
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 5 10.37 10.02 10.29 10.04 11.10 3.49 11.24 11.00
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 6 10.51 10.20 10.35 10.11 11.34 11.09 3.47 11.16
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 7 10.40 10.11 10.30 10.06 11.17 11.07 11.22 3.42
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">P2P=Enabled Latency (P2P Writes) Matrix (us)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> GPU 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 0 1.48 1.24 1.26 1.25 1.41 1.41 1.36 1.42
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1 1.19 1.38 1.18 1.18 1.29 1.42 1.29 1.26
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2 1.21 1.20 1.31 1.19 1.30 1.34 1.44 1.41
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 3 1.21 1.19 1.17 1.38 1.37 1.41 1.30 1.44
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4 1.69 1.69 1.69 1.64 1.38 1.50 1.59 1.56
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 5 1.64 1.60 1.60 1.62 1.50 1.43 1.56 1.48
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 6 1.59 1.53 1.57 1.54 1.48 1.44 1.39 1.44
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 7 1.58 1.58 1.57 1.56 1.48 1.47 1.45 1.37
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> CPU 0 1 2 3 4 5 6 7
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 0 3.27 2.84 2.76 2.74 2.80 2.76 2.76 2.75
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 1 2.80 3.13 2.66 2.74 2.70 2.70 2.68 2.69
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 2 2.83 2.80 3.26 2.85 2.85 2.78 2.77 2.76
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 3 2.78 2.69 2.70 3.24 2.69 2.70 2.98 2.67
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 4 3.18 3.11 3.10 3.09 3.55 3.12 3.09 3.08
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 5 3.12 3.04 3.10 3.05 3.06 3.50 3.08 3.04
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 6 3.20 3.11 3.18 3.11 3.11 3.16 3.57 3.08
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> 7 3.12 3.06 3.08 3.12 3.08 3.07 3.04 3.58
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h2 id="how-it-works-by-tinygrad">How it works? By tinygrad.
&lt;/h2>&lt;blockquote>
&lt;p>I am not an expert in such low-level hacking (but it&amp;rsquo;s soooo interesting and I want to learn). This part is from the &lt;a class="link" href="https://github.com/tinygrad/open-gpu-kernel-modules" target="_blank" rel="noopener"
>modified NVIDIA driver&lt;/a> by tinygrad (Thank you tinygrad). I just put it here for reference.&lt;/p>&lt;/blockquote>
&lt;p>Normally, P2P on NVIDIA cards uses MAILBOXP2P. This is some hardware interface designed to allow GPUs to transfer memory back in the days of small BAR. It is not present or disabled in hardware on the 4090s, and that&amp;rsquo;s why P2P doesn&amp;rsquo;t work. There &lt;a class="link" href="https://forums.developer.nvidia.com/t/standard-nvidia-cuda-tests-fail-with-dual-rtx-4090-linux-box/233202" target="_blank" rel="noopener"
>was a bug in early versions&lt;/a> of the driver that reported that it did work, and it was actually sending stuff on the PCIe bus. However, because the mailbox hardware wasn&amp;rsquo;t present, these copies wouldn&amp;rsquo;t go to the right place. You could even crash the system by doing something like &lt;code>torch.zeros(10000,10000).cuda().to(&amp;quot;cuda:1&amp;quot;)&lt;/code>&lt;/p>
&lt;p>In some 3090s and all 4090s, NVIDIA added large BAR support.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl">tiny@tiny14:~$ lspci -s 01:00.0 -v
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">01:00.0 VGA compatible controller: NVIDIA Corporation AD102 [GeForce RTX 4090] (rev a1) (prog-if 00 [VGA controller])
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Subsystem: Micro-Star International Co., Ltd. [MSI] Device 510b
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Physical Slot: 49
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Flags: bus master, fast devsel, latency 0, IRQ 377
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Memory at b2000000 (32-bit, non-prefetchable) [size=16M]
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Memory at 28800000000 (64-bit, prefetchable) [size=32G]
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Memory at 28400000000 (64-bit, prefetchable) [size=32M]
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> I/O ports at 3000 [size=128]
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Expansion ROM at b3000000 [virtual] [disabled] [size=512K]
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Capabilities: &amp;lt;access denied&amp;gt;
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Kernel driver in use: nvidia
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> Kernel modules: nvidiafb, nouveau, nvidia_drm, nvidia
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Notice how BAR1 is size 32G. In H100, they also added support for a PCIe mode that uses the BAR directly instead of the mailboxes, called BAR1P2P. So, what happens if we try to enable that on a 4090?&lt;/p>
&lt;p>We do this by bypassing the HAL and calling a bunch of the GH100 methods directly. Methods like &lt;code>kbusEnableStaticBar1Mapping_GH100&lt;/code>, which maps the entire VRAM into BAR1. This mostly just works, but we had to disable the use of that region in the &lt;code>MapAperture&lt;/code> function for some reason. Shouldn&amp;rsquo;t matter.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl">[ 3491.654009] NVRM: kbusEnableStaticBar1Mapping_GH100: Static bar1 mapped offset 0x0 size 0x5e9200000
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">[ 3491.793389] NVRM: kbusEnableStaticBar1Mapping_GH100: Static bar1 mapped offset 0x0 size 0x5e9200000
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Perfect, we now have the VRAM mapped. However, it&amp;rsquo;s not that easy to get P2P. When you run &lt;code>./simpleP2P&lt;/code> from &lt;code>cuda-samples&lt;/code>, you get this error.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl">[ 3742.840689] NVRM: kbusCreateP2PMappingForBar1P2P_GH100: added PCIe BAR1 P2P mapping between GPU2 and GPU3
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">[ 3742.840762] NVRM: kbusCreateP2PMappingForBar1P2P_GH100: added PCIe BAR1 P2P mapping between GPU3 and GPU2
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">[ 3742.841089] NVRM: nvAssertFailed: Assertion failed: (shifted &amp;gt;&amp;gt; pField-&amp;gt;shift) == value @ field_desc.h:272
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">[ 3742.841106] NVRM: nvAssertFailed: Assertion failed: (shifted &amp;amp; pField-&amp;gt;maskPos) == shifted @ field_desc.h:273
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">[ 3742.841281] NVRM: nvAssertFailed: Assertion failed: (shifted &amp;gt;&amp;gt; pField-&amp;gt;shift) == value @ field_desc.h:272
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">[ 3742.841292] NVRM: nvAssertFailed: Assertion failed: (shifted &amp;amp; pField-&amp;gt;maskPos) == shifted @ field_desc.h:273
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">[ 3742.865948] NVRM: GPU at PCI:0000:01:00: GPU-49c7a6c9-e3a8-3b48-f0ba-171520d77dd1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">[ 3742.865956] NVRM: Xid (PCI:0000:01:00): 31, pid=21804, name=simpleP2P, Ch 00000013, intr 00000000. MMU Fault: ENGINE CE3 HUBCLIENT_CE1 faulted @ 0x7f97_94000000. Fault is of type FAULT_INFO_TYPE_UNSUPPORTED_KIND ACCESS_TYPE_VIRT_WRITE
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Failing with an MMU fault. So you dive into this and find that it&amp;rsquo;s using &lt;code>GMMU_APERTURE_PEER&lt;/code> as the mapping type. That doesn&amp;rsquo;t seem supported in the 4090. So let&amp;rsquo;s see what types are supported, &lt;code>GMMU_APERTURE_VIDEO&lt;/code>,&lt;code>GMMU_APERTURE_SYS_NONCOH&lt;/code>, and &lt;code>GMMU_APERTURE_SYS_COH&lt;/code>. We don&amp;rsquo;t care about being coherent with the CPU&amp;rsquo;s L2 cache, but it does have to go out the PCIe bus, so we rewrite &lt;code>GMMU_APERTURE_PEER&lt;/code> to &lt;code>GMMU_APERTURE_SYS_NONCOH&lt;/code>. We also no longer set the peer id that was corrupting the page table.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-fallback" data-lang="fallback">&lt;span class="line">&lt;span class="cl">cudaMemcpyPeer / cudaMemcpy between GPU0 and GPU1: 24.21GB/s
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Preparing host buffer and memcpy to GPU0...
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Run kernel on GPU1, taking source data from GPU0 and writing to GPU1...
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Run kernel on GPU0, taking source data from GPU1 and writing to GPU0...
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Copy data back to host from GPU0 and verify results...
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Verification error @ element 1: val = 0.000000, ref = 4.000000
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Verification error @ element 2: val = 0.000000, ref = 8.000000
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Progress! &lt;code>./simpleP2P&lt;/code> appears to work, however the copy isn&amp;rsquo;t happening. The address is likely wrong. It turns out they have a separate field for the peer address called &lt;code>fldAddrPeer&lt;/code>, we change that to &lt;code>fldAddrSysmem&lt;/code>. We also print out the addresses and note that the physical BAR address isn&amp;rsquo;t being added properly, they provide a field &lt;code>fabricBaseAddress&lt;/code> for &lt;code>GMMU_APERTURE_PEER&lt;/code>, we reuse it and put the &lt;code>BAR1&lt;/code> base address in there.&lt;/p></description></item><item><title>Share NVIDIA GPU between CTs in Proxmox VE</title><link>https://charlie0129.github.io/blog/p/pve-ct-share-nvidia-gpu/</link><pubDate>Mon, 04 Nov 2024 12:57:00 +0800</pubDate><guid>https://charlie0129.github.io/blog/p/pve-ct-share-nvidia-gpu/</guid><description>&lt;h2 id="background">Background
&lt;/h2>&lt;p>Consider a small lab, students need to use GPU for their projects. We have a NVIDIA GPU in our Proxmox VE server, and we want to share the GPU between multiple containers so that multiple students can use the GPU at the same time.&lt;/p>
&lt;p>Why not use a VM? Because a GPU can only be passed through to one VM at a time (only one student can use the GPU at a time). And resources are not flexible in VMs.&lt;/p>
&lt;p>Why not create multiple users in the host and let them run their programs in the host? Because we want to isolate the students from the host, so that they can&amp;rsquo;t access the host and other students&amp;rsquo; data.&lt;/p>
&lt;p>Why not use Docker? Because Docker containers doesn&amp;rsquo;t have a full init system, and it&amp;rsquo;s hard to run some applications.&lt;/p>
&lt;p>Since we use PVE and it has LXC containers built-in (called CT), it is a perfect choice.&lt;/p>
&lt;h2 id="install-drivers-on-the-host">Install Drivers on the Host
&lt;/h2>&lt;p>Make sure the GPU is detected by the host. Note the NVIDIA GPUs &lt;code>3b:00.0&lt;/code> (Your address may differ).&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> lspci &lt;span class="p">|&lt;/span> grep -i nvidia
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">3b:00.0 VGA compatible controller: NVIDIA Corporation TU104GL [Quadro RTX 5000] (rev a1)
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">3b:00.1 Audio device: NVIDIA Corporation TU104 HD Audio Controller (rev a1)
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">3b:00.2 USB controller: NVIDIA Corporation TU104 USB 3.1 Host Controller (rev a1)
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">3b:00.3 Serial bus controller [0c80]: NVIDIA Corporation TU104 USB Type-C UCSI Controller (rev a1)
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;blockquote>
&lt;p>You may ask: does your entire lab only own one RTX 5000? What kind of lab is this? Are you cave people?&lt;/p>
&lt;p>Yes, although we have multiple projects worth over millions of Chinese Yuan, most of the money is gone to the some other places (which I cannot publicly speak on the Internet 🤫 ). And the professors have no emphasis on students&amp;rsquo; growth.
As a result, we are actually poor as hell.&lt;/p>
&lt;p>Since almost no one knows how to properly configure a Linux server, I want to help my classmates to learn more and let them use the only GPU. But to be honest, I won&amp;rsquo;t benefit from doing this. It&amp;rsquo;s just voluntary work.&lt;/p>&lt;/blockquote>
&lt;p>Install prerequisites. Note that I am using &lt;code>pve-headers-$(uname -r)&lt;/code> to install the headers for the current kernel. If you are using a different kernel, you may need to install the headers for that kernel. Also, you may want to use &lt;code>linux-headers-$(uname -r)&lt;/code> instead of &lt;code>pve-headers-$(uname -r)&lt;/code> if you are not using Proxmox VE.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> apt install -y gcc make pve-headers-&lt;span class="k">$(&lt;/span>uname -r&lt;span class="k">)&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Download CUDA toolkit from &lt;a class="link" href="https://developer.nvidia.com/cuda-downloads" target="_blank" rel="noopener"
>here&lt;/a> and install it. Drivers are included in the CUDA toolkit so you don&amp;rsquo;t need to install drivers separately.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> wget &amp;lt;cuda-runfile-download-url&amp;gt;
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> ./cuda_12.2.2_535.104.05_linux.run --silent
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>The default installation options will work fine. If anything fails, you can check the log file at &lt;code>/var/log/cuda-installer.log&lt;/code> for CUDA logs and &lt;code>/var/log/nvidia-installer.log&lt;/code> for NVIDIA driver logs.&lt;/p>
&lt;p>PS: You need to blacklist &lt;code>nouveau&lt;/code> driver. This is automatically done by PVE. If not, you can do this by creating a file &lt;code>/etc/modprobe.d/blacklist-nouveau.conf&lt;/code> with the following content: &lt;code>blacklist nouveau&lt;/code>. Then run &lt;code>update-initramfs -u&lt;/code> to update the initramfs.&lt;/p>
&lt;p>PPS: If you used to passthrough this GPU to a VM, be sure to remove the GPU from the VM&amp;rsquo;s hardware configuration in PVE otherwise PVE will bound the GPU to &lt;code>vfio-pci&lt;/code> (see &lt;code>Kernel driver in use&lt;/code> row in &lt;code>lspci -k&lt;/code>) and cannot be used by the host.&lt;/p>
&lt;p>PPPS: Some kernel versions are known to have problems with NVIDIA drivers. If you encounter problems, you may need to downgrade/upgrade the kernel. For example, kernel version 5.10.0 is known to have &lt;code> make[3]: *** No rule to make target 'scripts/module.lds', needed by '/tmp/selfgz38416/NVIDIA-Linux-x86_64-560.35.03/kernel-open/nvidia.ko'&lt;/code> error.&lt;/p>
&lt;p>After installation finished, check if the driver is loaded.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> nvidia-smi
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">Tue Nov 5 09:56:44 2024
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">+---------------------------------------------------------------------------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| NVIDIA-SMI 535.104.05 Driver Version: 535.104.05 CUDA Version: 12.2 |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">|-----------------------------------------+----------------------+----------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| | | MIG M. |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">|=========================================+======================+======================|
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| 0 Quadro RTX 5000 Off | 00000000:3B:00.0 Off | Off |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| 33% 44C P0 28W / 230W | 0MiB / 16384MiB | 6% Default |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| | | N/A |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">+-----------------------------------------+----------------------+----------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">+---------------------------------------------------------------------------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| Processes: |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| GPU GI CI PID Type Process name GPU Memory |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| ID ID Usage |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">|=======================================================================================|
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| No running processes found |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">+---------------------------------------------------------------------------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h2 id="allow-nvidia-device-passthrough-in-ct">Allow NVIDIA Device Passthrough in CT
&lt;/h2>&lt;p>Now we need to allow the CT to access the GPU. I am using an unprivileged container here. Edit the CT&amp;rsquo;s configuration file (&lt;code>/etc/pve/local/lxc/&amp;lt;id&amp;gt;.conf&lt;/code>). Add the following lines to the end of the file.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-diff" data-lang="diff">&lt;span class="line">&lt;span class="cl"> arch: amd64
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> cores: 4
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> features: nesting=1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> hostname: ct-gpu-tmpl-deb127-cu122
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> memory: 4096
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> net0: name=eth0,bridge=vmbr0,firewall=1,hwaddr=AA:AB:F0:07:42:D0,ip=dhcp,type=veth
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> ostype: debian
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> rootfs: local-zfs:basevol-8001-disk-0,size=16G
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> swap: 0
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> unprivileged: 1
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># These lines allow the container to access specific character devices (c) with rwm
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"># permissions (read, write, modify). These are needed for NVIDIA GPU access.
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.cgroup.devices.allow: c 195:* rwm
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.cgroup.devices.allow: c 509:* rwm
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.cgroup.devices.allow: c 235:* rwm
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">&lt;/span># These lines mount various GPU-related devices from the host into the container.
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.mount.entry: /dev/nvidia0 dev/nvidia0 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.mount.entry: /dev/nvidiactl dev/nvidiactl none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.mount.entry: /dev/nvidia-modeset dev/nvidia-modeset none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.mount.entry: /dev/nvidia-uvm dev/nvidia-uvm none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.mount.entry: /dev/nvidia-uvm-tools dev/nvidia-uvm-tools none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.mount.entry: /dev/dri dev/dri none bind,optional,create=dir
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gi">+ lxc.mount.entry: /dev/fb0 dev/fb0 none bind,optional,create=file
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>PS: If you cannot use &lt;code>nvidia-smi&lt;/code> (it says &lt;code>Failed to initialize NVML: Unknown Error&lt;/code>), there is a possibility that you are using &lt;code>cgroup2&lt;/code>. Change all the &lt;code>lxc.cgroup.devices.allow&lt;/code> lines to &lt;code>lxc.cgroup2.devices.allow&lt;/code>.&lt;/p>
&lt;p>&lt;strong>Explanation:&lt;/strong>&lt;/p>
&lt;p>Allows container access to NVIDIA device nodes:&lt;/p>
&lt;ul>
&lt;li>&lt;code>c 195:*&lt;/code> - NVIDIA character devices&lt;/li>
&lt;li>&lt;code>c 509:*&lt;/code> - NVIDIA UVM devices&lt;/li>
&lt;li>&lt;code>c 235:*&lt;/code> - NVIDIA CTL devices&lt;/li>
&lt;/ul>
&lt;p>Maps the following host GPU devices into container:&lt;/p>
&lt;ul>
&lt;li>&lt;code>/dev/nvidia0&lt;/code> - Main GPU device&lt;/li>
&lt;li>&lt;code>/dev/nvidiactl&lt;/code> - NVIDIA control device&lt;/li>
&lt;li>&lt;code>/dev/nvidia-modeset&lt;/code> - Display mode setting&lt;/li>
&lt;li>&lt;code>/dev/nvidia-uvm&lt;/code> - Unified memory management&lt;/li>
&lt;li>&lt;code>/dev/nvidia-uvm-tools&lt;/code> - UVM diagnostic tools&lt;/li>
&lt;li>&lt;code>/dev/dri&lt;/code> - Direct Rendering Infrastructure&lt;/li>
&lt;li>&lt;code>/dev/fb0&lt;/code> - Framebuffer device&lt;/li>
&lt;/ul>
&lt;p>Mount options:&lt;/p>
&lt;ul>
&lt;li>&lt;code>bind&lt;/code>: Mount as a bind mount&lt;/li>
&lt;li>&lt;code>optional&lt;/code>: Don&amp;rsquo;t fail if device doesn&amp;rsquo;t exist&lt;/li>
&lt;li>&lt;code>create=file/dir&lt;/code>: Create the mount point if it doesn&amp;rsquo;t exist&lt;/li>
&lt;/ul>
&lt;p>Note that if you are using a different GPU, you may need to change the device numbers. For example, &lt;code>/dev/nvidia1&lt;/code> instead of &lt;code>/dev/nvidia0&lt;/code>. You can find the device numbers in &lt;code>nvidia-smi&lt;/code> output.&lt;/p>
&lt;h2 id="install-drivers-in-ct">Install Drivers in CT
&lt;/h2>&lt;p>Log into the CT. All the following commands are run in the CT.&lt;/p>
&lt;p>You should be able to see NVIDIA devices inside the CT:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> ls -l /dev/nvidia*
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">---------- 1 root root 0 Nov 5 02:31 /dev/nvidia-modeset
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">crw-rw-rw- 1 nobody nogroup 507, 0 Nov 5 01:56 /dev/nvidia-uvm
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">crw-rw-rw- 1 nobody nogroup 507, 1 Nov 5 01:56 /dev/nvidia-uvm-tools
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">crw-rw-rw- 1 nobody nogroup 195, 0 Nov 5 01:56 /dev/nvidia0
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">crw-rw-rw- 1 nobody nogroup 195, 255 Nov 5 01:56 /dev/nvidiactl
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Install CUDA and drivers, just like you would on a physical machine, except that you don&amp;rsquo;t need to install the kernel modules. I will install CUDA 12.2 (drivers are included in the CUDA installer).&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> wget &amp;lt;cuda-runfile-download-url&amp;gt;
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> apt install -y gcc
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> ./cuda_12.2.2_535.104.05_linux.run --extract&lt;span class="o">=&lt;/span>&lt;span class="k">$(&lt;/span>&lt;span class="nb">pwd&lt;/span>&lt;span class="k">)&lt;/span>/cu122
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Note that I extracted the installer to manually install it because we want to skip kernel module installation and such options are not exposed in the installer.&lt;/p>
&lt;p>Install the bundled drivers:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="go">cd cu122
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">./NVIDIA-Linux-x86_64-535.104.05.run --no-nouveau-check --no-kernel-modules --silent
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Run &lt;code>nvidia-smi&lt;/code> to check if the driver is loaded.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> nvidia-smi
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">Tue Nov 5 05:49:02 2024
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">+---------------------------------------------------------------------------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| NVIDIA-SMI 535.104.05 Driver Version: 535.104.05 CUDA Version: 12.2 |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">|-----------------------------------------+----------------------+----------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| | | MIG M. |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">|=========================================+======================+======================|
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| 0 Quadro RTX 5000 Off | 00000000:3B:00.0 Off | Off |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| 33% 38C P0 23W / 230W | 0MiB / 16384MiB | 0% Default |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| | | N/A |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">+-----------------------------------------+----------------------+----------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">+---------------------------------------------------------------------------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| Processes: |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| GPU GI CI PID Type Process name GPU Memory |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| ID ID Usage |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">|=======================================================================================|
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">| No running processes found |
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">+---------------------------------------------------------------------------------------+
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>We can now see that the GPU is accessible in the CT.&lt;/p>
&lt;p>Let&amp;rsquo;s continue with the CUDA installation. Remember to uncheck the driver installation option because we have already installed the drivers above.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="go">./cuda-linux.12.2.2-535.104.05.run
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>After a successful installation, you should add cuda binaries to PATH. Instructions should be printed at the end of the installation. Then you can run &lt;code>nvcc&lt;/code> to see if CUDA is installed correctly.&lt;/p>
&lt;p>Everything should be working by this point.&lt;/p>
&lt;h2 id="missing-nvidia-uvm-and-high-idle-power-draw">Missing &lt;code>nvidia-uvm&lt;/code> and High Idle Power Draw
&lt;/h2>&lt;p>One problem I encountered is that when the host reboots, the GPU is not accessible in the CT. This is because &lt;code>nvidia-uvm&lt;/code> device isn&amp;rsquo;t created until an application attempts to interact with the graphics card. This is a problem because no application will interact with the GPU at boot, so no &lt;code>nvidia-uvm&lt;/code> device is created. But the CT needs the &lt;code>nvidia-uvm&lt;/code> device bind-mounted at CT-startup in order to access the GPU.&lt;/p>
&lt;p>Also, the graphics card have insanely high power draw at idle (over 100 Watts). The GPU is in P0 and never leaves it. We can use &lt;code>nvidia-persistenced&lt;/code> to let the GPU enter a low-power state (P8) when not in use.&lt;/p>
&lt;p>To solve this, we can run &lt;code>nvidia-smi -pm 1&lt;/code> (which enables &lt;code>nvidia-persistenced&lt;/code> and keeps nvidia character device and handles frequency scaling) at boot. Add the following line to the host&amp;rsquo;s crontab to run &lt;code>nvidia-smi -pm 1&lt;/code> at boot.&lt;/p>
&lt;p>PS: This only works if the host is a headless server (no monitor attached). If you have a monitor attached, you may need to run &lt;code>nvidia-smi&lt;/code> below instead.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-console" data-lang="console">&lt;span class="line">&lt;span class="cl">&lt;span class="gp">#&lt;/span> crontab -e
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="go">@reboot /usr/bin/nvidia-smi -pm 1
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h2 id="downsides">Downsides
&lt;/h2>&lt;p>Despite the fact that this method works best for us, there are some downsides:&lt;/p>
&lt;ul>
&lt;li>The CT will have full access to the GPU. If one CT uses all the GPU memory, other CTs will be starving. So you must trust the users of the CTs. This is not a problem for us because we know each other.&lt;/li>
&lt;li>Driver updates are a bit more complicated. You need to update the drivers on the host and in all of the CTs. It&amp;rsquo;s best to not update the drivers too often.&lt;/li>
&lt;li>The CTs share the same kernel with the host. To avoid potential compatibility issues, we don&amp;rsquo;t update the kernel unless necessary.&lt;/li>
&lt;/ul></description></item></channel></rss>