AI infrastructure roles, filterable by the stack you actually work on.
Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.
1296 open roles · 85 companies · last verified today
342 roles
Lightning AIai startup
London, England, United Kingdom · New York, New York +5 more · $180K–$250K · unknown
python-langsolutions-architectdistributed-inferenceinferenceinference-engines
posted 3mo ago · verified today
Lightning AIai startup
Singapore · 165K–205K SGD · senior
reliability-sresreansiblecluster-datacenterkubernetes-ops
posted 7w ago · verified today
Lightning AIai startup
London, England, United Kingdom · London, UK +7 more · remote · $160K–$200K · senior
reliability-sresreansiblecluster-datacenterkubernetes-ops
posted 3mo ago · verified today
Lightning AIai startup
London, England, United Kingdom · London, UK +7 more · remote · $180K–$220K · senior
object-storagepython-langstorage-checkpointingsoftware-engineercluster-datacenter
posted 4mo ago · verified today
Lightning AIai startup
New York, New York, United States · San Francisco, California +3 more · $115K–$140K · unknown
cudagpu-generickubernetes-opsnccl-libobservability
posted 3mo ago · verified today
Lightning AIai startup
London, England, United Kingdom · London, UK · £75K–£95K · unknown
cudagpu-generickubernetes-opsml-platformnccl-lib
posted 3mo ago · verified today
Lightning AIai startup
Philippines · Remote +1 more · unknown
reliability-sresrecluster-datacentergpu-generickubernetes-ops
posted 4mo ago · verified today
Etchedchip vendor
San Jose · onsite · $150K–$225K/year · unknown
gpu-kernelsperformance-engineerinferencepython-langobservability
posted 7w ago · verified today
Etchedchip vendor
San Jose · onsite · $200K–$300K/year · manager
observabilitydistributed-inferenceperformance-engineercpp-langeng-manager
posted 6mo ago · verified today
Etchedchip vendor
San Jose · onsite · $150K–$275K/year · unknown
kubernetes-opsobservabilitypython-langslurm-adminsoftware-engineer
posted 6mo ago · verified today
Etchedchip vendor
San Jose · onsite · $200K–$275K/year · unknown
cluster-datacentercpp-langlinux-kernelsoftware-engineerobservability
posted 15mo ago · verified today
Etchedchip vendor
San Jose · onsite · manager
cluster-datacentereng-managerinferenceinference-enginesnetwork-fabric
posted 5mo ago · verified today
Coherefrontier lab
Canada · United States · onsite · manager
eng-managercluster-datacenterkubernetes-opsgpu-genericobservability
posted 13d ago · verified today
Coherefrontier lab
Montreal · New York +2 more · remote · unknown
kubernetes-opssrecpp-langgo-langgpu-generic
posted 8mo ago · verified today
Coherefrontier lab
Canada · United States · hybrid · senior
cluster-datacentergo-langgpu-generickubernetes-opsnccl-lib
posted 13d ago · verified today
Reflection AIfrontier lab
London · New York, NY +1 more · onsite · unknown
kubernetes-opscluster-datacenternccl-libreliability-sregpu-generic
posted 6mo ago · verified today
RadixArkai startup
Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · unknown
gpu-genericpost-traininggpu-kernelsmodel-parallelismtraining-frameworks
posted 7mo ago · verified today
RadixArkai startup
Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · senior
inference-enginesgpu-genericinferenceperformance-engineerdistributed-inference
posted 7mo ago · verified today
RadixArkai startup
Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · senior
cluster-datacenterscheduling-orchestrationgpu-generickubernetes-opsnetwork-fabric
posted 7mo ago · verified today
RadixArkai startup
Palo Alto, CA · Radixark · $200K–$400K/year est. · mid
ml-platformgo-langkubernetes-opsobservabilitypython-lang
posted 8mo ago · verified today
falinference provider
Remote - USA · remote · $180K–$250K/year · senior
gpu-generickubernetes-opssoftware-engineercluster-datacentergpu-virtualization
posted 4w ago · verified today
falinference provider
Remote - APAC · remote · senior
inferencekubernetes-opsobservabilitypython-langreliability-sre
posted 11w ago · verified today
falinference provider
Remote - Global · senior
ml-platformpython-langrust-langscheduling-orchestrationsoftware-engineer
posted 6mo ago · verified today
falinference provider
San Francisco · $180K–$250K/year · mid
ansiblecudanvidiaobservabilitypython-lang
posted 6mo ago · verified today
falinference provider
Remote - Global · unknown
python-langgpu-genericcudanvidiareliability-sre
posted 6mo ago · verified today
falinference provider
San Francisco · $180K–$250K/year · unknown
ml-platformpython-langrust-langscheduling-orchestrationsoftware-engineer
posted 14mo ago · verified today
Parasailinference provider
San Mateo · senior
inferencereliability-sresreobservabilitykubernetes-ops
posted 7w ago · verified today
Inferactinference provider
San Francisco · onsite · $200K–$400K/year · unknown
reliability-sresreinferenceobservabilityvllm-engine
posted 3w ago · verified today
FriendliAIinference provider
San Francisco · hybrid · mid
solutions-architectgpu-kernelsinference-engineskubernetes-opsobservability
posted 6mo ago · verified today
Prime Intellectneocloud
San Francisco · onsite · unknown
kubernetes-opsml-platformfine-tuninggpu-genericnvidia
posted 10w ago · verified today