User Tools

Site Tools


自作クラスタ計算機:slurm_v25の基本設定

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revisionPrevious revision
Next revision
Previous revision
自作クラスタ計算機:slurm_v25の基本設定 [2026/07/09 03:52] – [認証鍵の設置] koudai自作クラスタ計算機:slurm_v25の基本設定 [2026/07/29 04:51] (current) – [設定ファイルの作成] koudai
Line 184: Line 184:
 # 以下はnode11〜node20が12コアCPUが2ソケット、node21〜node30が24コアCPUが2ソケットの例です。 # 以下はnode11〜node20が12コアCPUが2ソケット、node21〜node30が24コアCPUが2ソケットの例です。
 # RealMemoryの単位はメガバイト # RealMemoryの単位はメガバイト
 +NodeName=head
 NodeName=node[11-20] CPUs=24 Boards=1 SocketsPerBoard=2 CoresPerSocket=12 ThreadsPerCore=1 RealMemory=126000 State=UNKNOWN NodeName=node[11-20] CPUs=24 Boards=1 SocketsPerBoard=2 CoresPerSocket=12 ThreadsPerCore=1 RealMemory=126000 State=UNKNOWN
 NodeName=node[21-30] CPUs=48 Boards=1 SocketsPerBoard=2 CoresPerSocket=24 ThreadsPerCore=1 RealMemory=252000 State=UNKNOWN NodeName=node[21-30] CPUs=48 Boards=1 SocketsPerBoard=2 CoresPerSocket=24 ThreadsPerCore=1 RealMemory=252000 State=UNKNOWN
Line 221: Line 222:
 </code> </code>
  
-slurm.confでスペック以上の数値を指定すると、その計算ノード動かなくなります。+slurm.confでスペック以上の数値を指定すると、後述するsinfoで状態を見たとき、その計算ノードのSTATEがinvalidになって動かなくなります。
  
  
Line 250: Line 251:
 </code>  </code> 
  
-各計算ノードで鍵を設置と権限設定をします。+各計算ノードで鍵を設置と権限設定をします。
 (/etc/exports で /home に no_root_squash オプションが入っていることを確認してください) (/etc/exports で /home に no_root_squash オプションが入っていることを確認してください)
  
Line 259: Line 260:
 </code> </code>
  
 +NFSでno_root_squashを使いたくない場合は、いったん鍵をscpで各計算ノードの/tmpディレクトリに送り込んで、そこから/etc/slurm/にコピーする方法もあります。
  
  
Line 276: Line 277:
 [Service] [Service]
 ExecStart= ExecStart=
-ExecStart=/usr/sbin/slurmd --systemd --conf-server head+ExecStart=/usr/sbin/slurmd --systemd --conf-server 192.168.0.1
 </file> </file>
  
Line 316: Line 317:
 <code> <code>
 $ sudo scontrol reconfigure $ sudo scontrol reconfigure
-$ sudo scontrol update NodeName=node[11-30] State=RESUME   # 計算ノードに設定が反映されない場合 
 </code> </code>
 +
 +ノードの停止と再開(OSのアップデートなど、ノードでなにか作業するときはノードを一旦停止させてください)
 +<code>
 +$ sudo scontrol update nodename=node[11-30] state=drain Reason="none"    # 停止
 +$ sudo scontrol update nodename=node[11-30] state=resume                 # 再開
 +</code>
 +
 +Reasonのところは停止時の記録用なので、なんでもいいです(半角スペース一個とかでも可)。
  
 ====== 使い方 ====== ====== 使い方 ======
Line 332: Line 340:
 #SBATCH --ntasks-per-node=2         # 1ノードあたりのMPIプロセス数 (mpiprocs=2) #SBATCH --ntasks-per-node=2         # 1ノードあたりのMPIプロセス数 (mpiprocs=2)
 #SBATCH --cpus-per-task=6           # 1MPIプロセスあたりのCPUコア数 (ompthreads=6) #SBATCH --cpus-per-task=6           # 1MPIプロセスあたりのCPUコア数 (ompthreads=6)
 +#SBATCH --mem=30G                   # ジョブの使用するメモリ
 #SBATCH -o %x.%j.out                # 標準出力ファイル名 (ジョブ名.ジョブID.out) #SBATCH -o %x.%j.out                # 標準出力ファイル名 (ジョブ名.ジョブID.out)
 #SBATCH -e %x.%j.err                # 標準エラーファイル名 #SBATCH -e %x.%j.err                # 標準エラーファイル名
Line 351: Line 360:
     * scancel: 実行中または待機中のジョブを取り消す(キャンセルする)。JobIDはsqueueコマンドで確認できます。<code>$ scancel <jobID></code>     * scancel: 実行中または待機中のジョブを取り消す(キャンセルする)。JobIDはsqueueコマンドで確認できます。<code>$ scancel <jobID></code>
   * ステータスの確認:   * ステータスの確認:
-    * sinfo: クラスター内のノードの状態(idle, alloc, downなど)やパーティションの一覧を表示する。<code>$ sinfo</code> +    * sinfo: クラスター内のノードの状態(idle, alloc, downなど)やパーティションの一覧を表示する。<code> 
-    * squeue: 現在キューに溜まっている、または実行中のジョブの一覧を表示する。<code>$ squeue</code>+$ sinfo 
 +$ sinfo -N                          # ノードごとの情報を見る 
 +$ sinfo -N -o "%15N %10c %25A %C"   # ノードごとのCPUの空き情報を見る 
 +</code
 +      * ノードごとのCPUの空き情報はよく見るので、エイリアスをbashrcに登録しておくと楽です。<file - .bashrc> 
 +alias cpufree='sinfo -N -o "%15N %10c %25A %C" | awk '\''!a[$0]++'\''' 
 +</file>  
 +    * squeue: 現在キューに溜まっている、または実行中のジョブの一覧を表示する。<code> 
 +$ squeue 
 +$ squeue -S +i   # JobIDが小さい順に並べる 
 +$ squeue -S -i   # JobIDが大きい順に並べる</code>
     * sacct: 過去に実行したジョブの履歴や消費リソースの統計(※データベース連携時)を確認する。<code>$ sacct</code>     * sacct: 過去に実行したジョブの履歴や消費リソースの統計(※データベース連携時)を確認する。<code>$ sacct</code>
  
自作クラスタ計算機/slurm_v25の基本設定.1783536767.txt.gz · Last modified: 2026/07/09 03:52 by koudai