Yazılım

Yazılım

Rocky Linux

RHEL ile yüksek uyumluluk sağlayan, ücretsiz ve kurumsal sunucu ortamlarında yaygın kullanılan Linux dağıtımıdır. HPC cluster’larında compute node, login node ve management node işletim sistemi olarak tercih edilebilir. Slurm, OpenHPC ve NVIDIA yazılım ekosistemiyle birlikte kullanılabilir.

Red Hat Enterprise Linux (RHEL)

Kurumsal Linux platformudur. Büyük ölçekli HPC ve AI altyapılarında güvenlik, destek ve uzun yaşam döngüsü gerektiren sistemlerde kullanılır. Cluster yönetimi, GPU altyapıları ve kurumsal yazılım ekosistemleriyle güçlü entegrasyon sunar.

Ubuntu Server

HPC, AI ve GPU sunucularında kullanılan popüler Linux dağıtımlarından biridir. NVIDIA CUDA, Kubernetes, Docker, Apptainer, Slurm ve çeşitli AI framework’leriyle geniş bir ekosisteme sahiptir. Özellikle AI/ML geliştirme ortamlarında güçlü bir tercihtir.

SUSE Linux Enterprise Server (SLES)

Kurumsal Linux platformudur ve HPC ile süper bilgisayar altyapılarında kullanılan işletim sistemlerinden biridir. Yüksek erişilebilirlik, güvenlik ve kurumsal destek gerektiren cluster ortamlarında tercih edilir. Slurm ve çeşitli HPC yazılım stack’leriyle kullanılabilir.

openEuler

Özellikle veri merkezi, cloud ve yüksek performanslı hesaplama altyapıları için geliştirilen açık kaynaklı Linux dağıtımıdır. OpenHPC’nin güncel sürümlerinde desteklenen işletim sistemi seçeneklerinden biridir.

Debian

Kararlı ve geniş paket ekosistemine sahip bir Linux dağıtımıdır. HPC cluster’larında daha özelleştirilmiş ve topluluk odaklı altyapılar için kullanılabilir. Slurm gibi HPC workload manager’ları tarafından desteklenen platformlar arasındadır.

BlueBanquise

Ansible tabanlı, HPC ve sunucu cluster’larının otomatik kurulumu ve yönetimi için kullanılan bir stack’tir. Bare-metal sistemlerin yapılandırılmasını, node’ların yönetilmesini ve karmaşık cluster mimarilerinin standartlaştırılmasını sağlar. Küçük sistemlerden büyük HPC cluster’larına kadar kullanılabilir.

OpenHPC

HPC cluster oluşturmak için gerekli birçok bileşeni bir araya getiren açık kaynaklı bir yazılım ekosistemidir. Provisioning, resource management, runtime, geliştirme araçları, container ve bilimsel kütüphaneler gibi bileşenleri hazır paketler halinde sunar.

xCAT

Cluster, sunucu ve bare-metal sistemlerin provisioning ve merkezi yönetimi için kullanılan bir cluster management framework’üdür. İşletim sistemi dağıtımı, node yapılandırması ve donanım yönetimi gibi işlemleri merkezi hale getirir.

Warewulf

HPC cluster’larında compute node’ların hızlı şekilde provisioning edilmesini sağlayan açık kaynaklı bir sistemdir. Node image yönetimi ve bare-metal deployment için kullanılır. OpenHPC 4.x içerisinde desteklenen modern provisioning seçeneklerinden biridir.

OpenCHAMI

HPC sistemlerinin bare-metal provisioning ve yönetimi için modern, API tabanlı bir altyapıdır. Özellikle büyük ölçekli HPC sistemlerinin donanım ve yazılım yaşam döngüsünü otomatikleştirmek için tasarlanmıştır. OpenHPC’nin modern provisioning seçeneklerinden biridir.

Confluent

Bare-metal sunucu provisioning ve cluster yönetimi için kullanılan bir sistemdir. Donanım keşfi, işletim sistemi kurulumu ve node yapılandırmasının otomatikleştirilmesine yardımcı olur. Modern HPC provisioning ekosisteminde OpenHPC ile birlikte kullanılabilen seçeneklerdendir.

NVIDIA Base Command Manager (BCM)

HPC ve AI cluster’larının provisioning, yönetim ve monitoring işlemlerini tek platform altında birleştirir. GPU cluster’larının kurulumu, yönetimi, sağlık kontrolü ve workload yönetimi için kapsamlı bir çözüm sunar.

Bright Cluster Manager

HPC ve AI cluster’larının kurulumu, provisioning ve merkezi yönetimi için kullanılan ticari bir cluster management platformudur. CPU ve GPU sistemlerini yönetebilir; Kubernetes ve hibrit cloud ortamlarıyla entegre olabilir

Slurm

Dünyada en yaygın kullanılan açık kaynak HPC workload manager ve job scheduler’larından biridir. Kullanıcıların CPU, GPU, RAM ve node gibi kaynakları talep etmesini, işlerin queue’ya alınmasını, çalıştırılmasını ve izlenmesini sağlar. Büyük ve küçük Linux cluster’larında kullanılabilir.

OpenPBS

HPC cluster’ları, cloud altyapıları ve süper bilgisayarlarda job scheduling ve workload management için kullanılan açık kaynaklı bir sistemdir. Kuyruk, kaynak tahsisi, job önceliği ve policy-based scheduling gibi özellikler sunar

PBS Professional

Kurumsal HPC ortamlarında kullanılan ticari workload manager ve scheduler’dır. Büyük cluster’larda job scheduling, kaynak yönetimi, politika ve SLA yönetimi için kullanılır. Özellikle kurumsal ve büyük ölçekli HPC altyapılarında güçlü bir seçenektir.

IBM Spectrum LSF

Kurumsal workload management ve job scheduling platformudur. HPC, grid computing ve yoğun hesaplama ortamlarında CPU/GPU kaynaklarının merkezi şekilde yönetilmesini sağlar. Büyük kurumların karmaşık iş yüklerini kuyruklar ve politikalar üzerinden çalıştırmasına olanak tanır.

Altair Grid Engine

HPC ve dağıtık hesaplama ortamlarında workload scheduling için kullanılan bir sistemdir. İşleri kuyruklara yerleştirir, mevcut kaynaklara göre dağıtır ve cluster kullanımını optimize etmeye yardımcı olur.

Flux Framework

Lawrence Livermore National Laboratory tarafından geliştirilen, yeni nesil HPC resource management framework’üdür. Geleneksel scheduler’ların ötesinde hiyerarşik kaynak yönetimi, karmaşık workflow’lar ve çok büyük ölçekli HPC iş yükleri için tasarlanmıştır.

Kubernetes

Container tabanlı uygulamaların deployment, scaling ve yönetimini otomatikleştiren açık kaynaklı orchestration platformudur. GPU’lu AI cluster’larında Kubernetes; model training, inference, distributed workloads ve servislerin yönetimi için kullanılabilir.

Kueue

Kubernetes üzerinde batch, HPC ve AI/ML workload’ları için queueing ve resource management sağlar. Kullanıcı ve ekipler arasında CPU/GPU kaynaklarını kota, öncelik ve queue politikalarıyla dağıtır. Kubernetes-native HPC ve AI ortamları için özellikle değerlidir.

Volcano

Kubernetes üzerinde AI, Big Data ve HPC gibi batch workload’ları için geliştirilmiş scheduler sistemidir. Gang scheduling, queue management ve GPU yoğun iş yüklerinin daha uygun şekilde planlanması gibi özellikler sağlar.

Kubeflow

Kubernetes üzerinde AI/ML iş yükleri için modüler bir platformdur. Model training, pipeline, inference ve AI yaşam döngüsünün farklı aşamalarını Kubernetes-native şekilde yönetmeye yardımcı olur. HPC ve AI kullanım senaryolarını da destekleyen genişletilebilir bir ekosistemdir.

KubeRay

Ray’in Kubernetes üzerinde çalıştırılması ve yönetilmesi için kullanılan Kubernetes operator ekosistemidir. Dağıtık Python, AI/ML, reinforcement learning, inference ve büyük veri iş yüklerinin Kubernetes cluster’larında çalıştırılmasını kolaylaştırır.

NVIDIA GPU Operator

Kubernetes cluster’larında NVIDIA GPU’ların kullanılabilmesi için gerekli driver, container toolkit, device plugin ve monitoring bileşenlerinin yönetimini otomatikleştirir. GPU cluster kurulumlarını standartlaştırmak için kullanılır.

dstack

GPU provisioning ve AI workload orchestration için geliştirilmiş açık kaynaklı bir control plane’dir. Kubernetes, bare-metal ve farklı cloud GPU altyapılarını tek bir arayüz altında yönetebilir. Training, inference ve AI workload’larının kaynaklar arasında çalıştırılmasını kolaylaştırır.

SkyPilot

AI workload’larını farklı cloud, Kubernetes, Slurm ve mevcut GPU cluster’ları üzerinde tek bir arayüzden çalıştırmayı sağlayan bir orchestration sistemidir. GPU kaynaklarının bulunması, job çalıştırılması, ölçekleme ve kaynak optimizasyonu gibi işlemleri kolaylaştırır.

NVIDIA Base Command Platform

AI geliştiricileri ve veri bilimcilerinin GPU altyapıları üzerinde AI workload’ları çalıştırmasına yönelik bir platformdur. NVIDIA ekosistemiyle entegre şekilde model geliştirme, job çalıştırma ve AI kaynaklarının kullanımını kolaylaştırır

Apptainer

HPC ortamları için tasarlanmış container platformudur. Kullanıcıların karmaşık yazılım ortamlarını container içerisinde çalıştırmasını sağlar. Root yetkisi gerektirmeden çalışabilmesi ve Docker/OCI image’larıyla çalışabilmesi nedeniyle HPC cluster’larında yaygın şekilde kullanılır

Charliecloud

HPC sistemlerinde container çalıştırmak için geliştirilen hafif ve kullanıcı alanında çalışan bir container çözümüdür. Özellikle Docker benzeri image’ların HPC ortamlarında daha kontrollü şekilde çalıştırılması için kullanılabilir. OpenHPC ekosisteminde yer alan bileşenlerden biridir

Docker

Container uygulamalarının oluşturulması, paketlenmesi ve çalıştırılması için kullanılan popüler platformdur. HPC’de özellikle geliştirme ve test ortamlarında kullanılır; production HPC workload’larında ise güvenlik ve yetki modeli nedeniyle çoğunlukla Apptainer gibi HPC odaklı çözümler tercih edilir.

Open MPI

MPI standardının açık kaynaklı bir implementasyonudur. Birden fazla compute node üzerinde çalışan paralel uygulamaların birbirleriyle haberleşmesini sağlar. HPC, CFD, mühendislik simülasyonları ve bilimsel hesaplamalarda temel yazılım bileşenlerinden biridir.

MPICH

MPI standardının yüksek performanslı ve taşınabilir açık kaynak implementasyonudur. Çok düğümlü HPC uygulamalarında prosesler arası iletişim için kullanılır ve birçok modern süper bilgisayar yazılım stack’inde yer alır.

Intel MPI

Intel oneAPI ekosisteminin MPI kütüphanesidir. Çok düğümlü HPC uygulamalarında düşük gecikmeli ve yüksek bant genişlikli iletişim sağlar. Intel ve uyumlu işlemcilerle çalışan HPC uygulamalarında performans optimizasyonu için kullanılabilir.

NVIDIA NCCL

NVIDIA GPU’ları arasında yüksek performanslı collective communication sağlayan kütüphanedir. Özellikle distributed deep learning ve multi-GPU/multi-node AI training sistemlerinde GPU’lar arasındaki veri iletişimini optimize eder.

PMIx

HPC ortamlarında proses yönetimi ve MPI/runtime bileşenleri arasında standartlaştırılmış bilgi alışverişi sağlayan bir arayüzdür. MPI uygulamalarının cluster kaynakları ve process manager ile daha verimli şekilde entegre edilmesine yardımcı olur.

Spack

HPC yazılımlarının farklı compiler, MPI, CUDA ve kütüphane sürümleriyle birlikte kurulmasını ve yönetilmesini sağlayan paket yöneticisidir. Aynı cluster üzerinde bir yazılımın farklı sürümlerinin ve farklı optimizasyonlarının yönetilmesini kolaylaştırır.

Environment Modules

HPC kullanıcılarının compiler, MPI, CUDA, Python ve uygulama sürümlerini kolayca değiştirmesini sağlayan modül sistemidir. Örneğin kullanıcı tek bir komutla farklı GCC, CUDA veya MPI sürümünü aktif hale getirebilir.

Lmod

Environment Modules sisteminin modern ve gelişmiş alternatiflerinden biridir. HPC cluster’larında yazılım ortamlarının modüller aracılığıyla yönetilmesini sağlar. Büyük sistemlerde bağımlılıkların ve farklı yazılım sürümlerinin düzenli şekilde kullanılmasına yardımcı olur.

Prometheus

Sunucu ve uygulamalardan metrik toplayan açık kaynak monitoring sistemidir. CPU, RAM, GPU, network ve cluster metriklerinin zaman serisi olarak toplanması ve alarm sistemleriyle kullanılmasını sağlar.

Grafana

Prometheus ve diğer veri kaynaklarından gelen HPC/AI metriklerini görsel dashboard’lar halinde sunar. GPU kullanımı, CPU yükü, RAM, network throughput, node health ve job metriklerinin izlenmesi için kullanılabilir.

NVIDIA DCGM

NVIDIA GPU’larının sağlık, performans ve kullanım metriklerini izlemek için kullanılan yönetim ve monitoring yazılımıdır. GPU cluster’larında sıcaklık, utilization, memory ve hata durumlarının takip edilmesine yardımcı olur.

Ganglia

Özellikle HPC cluster’larında node ve sistem metriklerini izlemek için kullanılan dağıtık monitoring sistemidir. CPU, memory, network ve diğer sistem kaynaklarının merkezi olarak görüntülenmesini sağlar.

Lustre

Büyük HPC cluster’larında yüksek throughput ve paralel I/O sağlamak için kullanılan dağıtık paralel dosya sistemidir. Bilimsel hesaplama, simülasyon ve AI training gibi büyük veri iş yüklerinde yüksek performanslı storage altyapısı oluşturmak için kullanılır.

BeeGFS

HPC ve AI ortamları için geliştirilmiş paralel dosya sistemidir. Compute node’ların aynı storage üzerinde yüksek bant genişliğiyle veri okuyup yazmasını sağlar. Büyük veri kümeleri, simülasyonlar ve GPU training workload’ları için kullanılabilir.

IBM Storage Scale

Kurumsal ve HPC ortamlarında kullanılan yüksek performanslı paralel dosya sistemi ve veri platformudur. Büyük ölçekli dosya sistemleri, AI, HPC ve analytics iş yükleri için yüksek performanslı ve ölçeklenebilir veri erişimi sağlar.

Ceph

Dağıtık object, block ve file storage sağlayan açık kaynaklı storage platformudur. HPC’de geleneksel paralel filesystem’lerin yanında veri depolama, VM storage ve cluster altyapılarında kullanılabilir.

InfiniBand

HPC ve AI cluster’larında çok düşük gecikme ve yüksek bant genişliği sağlayan yüksek performanslı network teknolojisidir. MPI ve NVIDIA NCCL gibi yazılımlarla birlikte kullanılarak multi-node GPU ve CPU workload’larının iletişim performansını artırır.

NVIDIA Quantum InfiniBand

NVIDIA’nın yüksek performanslı InfiniBand switch ve network ailesidir. Büyük HPC ve AI cluster’larında GPU/CPU node’ları arasında düşük gecikmeli ve yüksek bant genişlikli iletişim için kullanılır.