User Tools

Site Tools


自作クラスタ計算機:slurm_v25の基本設定

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revisionPrevious revision
Next revision
Previous revision
自作クラスタ計算機:slurm_v25の基本設定 [2026/07/11 04:15] – [管理] koudai自作クラスタ計算機:slurm_v25の基本設定 [2026/07/29 04:51] (current) – [設定ファイルの作成] koudai
Line 184: Line 184:
 # 以下はnode11〜node20が12コアCPUが2ソケット、node21〜node30が24コアCPUが2ソケットの例です。 # 以下はnode11〜node20が12コアCPUが2ソケット、node21〜node30が24コアCPUが2ソケットの例です。
 # RealMemoryの単位はメガバイト # RealMemoryの単位はメガバイト
 +NodeName=head
 NodeName=node[11-20] CPUs=24 Boards=1 SocketsPerBoard=2 CoresPerSocket=12 ThreadsPerCore=1 RealMemory=126000 State=UNKNOWN NodeName=node[11-20] CPUs=24 Boards=1 SocketsPerBoard=2 CoresPerSocket=12 ThreadsPerCore=1 RealMemory=126000 State=UNKNOWN
 NodeName=node[21-30] CPUs=48 Boards=1 SocketsPerBoard=2 CoresPerSocket=24 ThreadsPerCore=1 RealMemory=252000 State=UNKNOWN NodeName=node[21-30] CPUs=48 Boards=1 SocketsPerBoard=2 CoresPerSocket=24 ThreadsPerCore=1 RealMemory=252000 State=UNKNOWN
Line 221: Line 222:
 </code> </code>
  
-slurm.confでスペック以上の数値を指定すると、その計算ノード動かなくなります。+slurm.confでスペック以上の数値を指定すると、後述するsinfoで状態を見たとき、その計算ノードのSTATEがinvalidになって動かなくなります。
  
  
Line 320: Line 321:
 ノードの停止と再開(OSのアップデートなど、ノードでなにか作業するときはノードを一旦停止させてください) ノードの停止と再開(OSのアップデートなど、ノードでなにか作業するときはノードを一旦停止させてください)
 <code> <code>
-$ sudo scontrol update nodename=node[11-30] state=drain    # 停止 +$ sudo scontrol update nodename=node[11-30] state=drain Reason="none"    # 停止 
-$ sudo scontrol update nodename=node[11-30] state=resume   # 再開+$ sudo scontrol update nodename=node[11-30] state=resume                 # 再開
 </code> </code>
 +
 +Reasonのところは停止時の記録用なので、なんでもいいです(半角スペース一個とかでも可)。
  
 ====== 使い方 ====== ====== 使い方 ======
Line 337: Line 340:
 #SBATCH --ntasks-per-node=2         # 1ノードあたりのMPIプロセス数 (mpiprocs=2) #SBATCH --ntasks-per-node=2         # 1ノードあたりのMPIプロセス数 (mpiprocs=2)
 #SBATCH --cpus-per-task=6           # 1MPIプロセスあたりのCPUコア数 (ompthreads=6) #SBATCH --cpus-per-task=6           # 1MPIプロセスあたりのCPUコア数 (ompthreads=6)
 +#SBATCH --mem=30G                   # ジョブの使用するメモリ
 #SBATCH -o %x.%j.out                # 標準出力ファイル名 (ジョブ名.ジョブID.out) #SBATCH -o %x.%j.out                # 標準出力ファイル名 (ジョブ名.ジョブID.out)
 #SBATCH -e %x.%j.err                # 標準エラーファイル名 #SBATCH -e %x.%j.err                # 標準エラーファイル名
Line 356: Line 360:
     * scancel: 実行中または待機中のジョブを取り消す(キャンセルする)。JobIDはsqueueコマンドで確認できます。<code>$ scancel <jobID></code>     * scancel: 実行中または待機中のジョブを取り消す(キャンセルする)。JobIDはsqueueコマンドで確認できます。<code>$ scancel <jobID></code>
   * ステータスの確認:   * ステータスの確認:
-    * sinfo: クラスター内のノードの状態(idle, alloc, downなど)やパーティションの一覧を表示する。<code>$ sinfo</code> +    * sinfo: クラスター内のノードの状態(idle, alloc, downなど)やパーティションの一覧を表示する。<code> 
-    * squeue: 現在キューに溜まっている、または実行中のジョブの一覧を表示する。<code>$ squeue</code>+$ sinfo 
 +$ sinfo -N                          # ノードごとの情報を見る 
 +$ sinfo -N -o "%15N %10c %25A %C"   # ノードごとのCPUの空き情報を見る 
 +</code
 +      * ノードごとのCPUの空き情報はよく見るので、エイリアスをbashrcに登録しておくと楽です。<file - .bashrc> 
 +alias cpufree='sinfo -N -o "%15N %10c %25A %C" | awk '\''!a[$0]++'\''' 
 +</file>  
 +    * squeue: 現在キューに溜まっている、または実行中のジョブの一覧を表示する。<code> 
 +$ squeue 
 +$ squeue -S +i   # JobIDが小さい順に並べる 
 +$ squeue -S -i   # JobIDが大きい順に並べる</code>
     * sacct: 過去に実行したジョブの履歴や消費リソースの統計(※データベース連携時)を確認する。<code>$ sacct</code>     * sacct: 過去に実行したジョブの履歴や消費リソースの統計(※データベース連携時)を確認する。<code>$ sacct</code>
  
自作クラスタ計算機/slurm_v25の基本設定.1783710945.txt.gz · Last modified: 2026/07/11 04:15 by koudai