前置条件

  • 架构: x86_64
  • 芯片型号: 通用 GPU
  • 宿主机驱动: 610.43.02
  • 容器工具包 (可选) : nvidia-container-toolkit

镜像内容

基于

harbor.baai.ac.cn/flagos-runtime/flagos-runtime-nvidia-cuda13.3:2.2.0 open_in_new

Python

3.12

应用软件包

megatron-core[training]==0.17.1

启动

已发布: harbor.baai.ac.cn/flagos-app/megatron_training0.17.1-generic-13.3:2.2.0-0.2.3

镜像名较长——先将其设为变量:

  IMG=harbor.baai.ac.cn/flagos-app/megatron_training0.17.1-generic-13.3:2.2.0-0.2.3
  

以下两种方式任选其一:

使用容器工具包

启动交互式 shell:

  docker run --rm -it \
  --gpus all \
  $IMG bash
  

以默认设置启动应用:

  docker run --rm -it \
  --gpus all \
  $IMG
  

向启动器传参:

  docker run --rm -it \
  --gpus all \
  $IMG megatron-train --model-type GPT
  

无需工具包——直接使用 docker / podman

启动交互式 shell:

  docker run --rm -it \
  --device /dev/nvidia0 \
  --device /dev/nvidiactl \
  --device /dev/nvidia-uvm \
  -v /usr/bin/nvidia-smi:/usr/bin/nvidia-smi:ro \
  -v /usr/lib/x86_64-linux-gnu/libnvidia-ml.so.1:/usr/lib/x86_64-linux-gnu/libnvidia-ml.so.1:ro \
  -v /usr/lib/x86_64-linux-gnu/libcuda.so.1:/usr/lib/x86_64-linux-gnu/libcuda.so.1:ro \
  $IMG bash
  

以默认设置启动应用:

  docker run --rm -it \
  --device /dev/nvidia0 \
  --device /dev/nvidiactl \
  --device /dev/nvidia-uvm \
  -v /usr/bin/nvidia-smi:/usr/bin/nvidia-smi:ro \
  -v /usr/lib/x86_64-linux-gnu/libnvidia-ml.so.1:/usr/lib/x86_64-linux-gnu/libnvidia-ml.so.1:ro \
  -v /usr/lib/x86_64-linux-gnu/libcuda.so.1:/usr/lib/x86_64-linux-gnu/libcuda.so.1:ro \
  $IMG
  

向启动器传参:

  docker run --rm -it \
  --device /dev/nvidia0 \
  --device /dev/nvidiactl \
  --device /dev/nvidia-uvm \
  -v /usr/bin/nvidia-smi:/usr/bin/nvidia-smi:ro \
  -v /usr/lib/x86_64-linux-gnu/libnvidia-ml.so.1:/usr/lib/x86_64-linux-gnu/libnvidia-ml.so.1:ro \
  -v /usr/lib/x86_64-linux-gnu/libcuda.so.1:/usr/lib/x86_64-linux-gnu/libcuda.so.1:ro \
  $IMG megatron-train --model-type GPT
  

Last updated 24 Sep 2026, 13:40 +0800. history