AI infrastructure roles, filterable by the stack you actually work on.
Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.
1296 open roles · 85 companies · last verified today
196 roles
FriendliAIinference provider
Seoul · onsite · mid
amdcpp-langcudacutlass-cutegpu-kernels
posted 4mo ago · verified today
FriendliAIinference provider
San Francisco · hybrid · mid
amdcpp-langcudagpu-genericgpu-kernels
posted 6mo ago · verified today
NexGen Cloudneocloud
London · London, England, United Kingdom, UK - Remote +1 more · remote · unknown
solutions-architectcudacudnn-libdeepspeed-libgpu-generic
posted 8w ago · verified today
NexGen Cloudneocloud
London · Nottingham · senior
kubernetes-opscluster-datacentergpu-genericnvidiascheduling-orchestration
posted 5mo ago · verified today
NexGen Cloudneocloud
Canada - Remote · Quebec, Canada · unknown
kubernetes-opscluster-datacenterdatacenter-engineergpu-genericreliability-sre
posted 14d ago · verified today
NexGen Cloudneocloud
UK - Remote · remote · senior
cudanvidiacluster-datacenternetwork-fabriccudnn-lib
posted 4mo ago · verified today
Prime Intellectneocloud
San Francisco · onsite · unknown
kubernetes-opsml-platformfine-tuninggpu-genericnvidia
posted 10w ago · verified today
Prime Intellectneocloud
Remote · San Francisco · hybrid · unknown
cluster-datacentergpu-genericinfiniband-opskubernetes-opsnetwork-fabric
posted 10w ago · verified today
Radiantneocloud
London · hybrid · mid
datacenter-engineercluster-datacenternvidiagpu-genericobservability
posted 3w ago · verified today
Radiantneocloud
London · hybrid · senior
cluster-datacenterdatacenter-engineergpu-genericinfiniband-opsnetwork-fabric
posted 6w ago · verified today
Radiantneocloud
Gloucestershire · London · hybrid · senior
reliability-sresrecluster-datacentergpu-genericnvidia
posted 3mo ago · verified today
TensorWaveneocloud
Las Vegas, Nevada · onsite · mid
amdgpu-generickubernetes-opsreliability-srescheduling-orchestration
posted 3w ago · verified today
Baseteninference provider
San Francisco · hybrid · $225K–$235K/year · senior
cluster-datacentergpu-genericreliability-sreobservabilitynvidia
posted 11d ago · verified today
Baseteninference provider
San Francisco · hybrid · $265K–$285K/year · manager
cluster-datacenternvidiagpu-genericnetwork-fabricinfiniband-ops
posted 11d ago · verified today
Nscaleneocloud
Austin, TX · Houston +3 more · staff plus
ansiblecluster-datacentercollectivescpp-langdeepspeed-lib
posted 13d ago · verified today
Nscaleneocloud
Houston · New York +2 more · staff plus
nvidiasoftware-engineercluster-datacentercudago-lang
posted 4w ago · verified today
Nscaleneocloud
Houston · San Francisco +1 more · $120K–$170K · senior
nvidiasrecluster-datacenterinfiniband-opsnccl-lib
posted 6mo ago · verified today
Nscaleneocloud
Houston · New York +2 more · staff plus
cluster-datacenternetwork-fabricgpu-genericnvidiainfiniband-ops
posted 3w ago · verified today
Nscaleneocloud
Houston · New York +2 more · staff plus
infiniband-opsnetwork-engineernetwork-fabricrdma-verbsroce-net
posted 5w ago · verified today
Nscaleneocloud
UK · staff plus
ansibleinfiniband-opsnetwork-engineernetwork-fabricpython-lang
posted 3w ago · verified today
Nscaleneocloud
Norway · manager
cluster-datacentereng-managerdatacenter-engineergpu-genericnvidia
posted 8w ago · verified today
Nscaleneocloud
Iceland · manager
cluster-datacentergpu-genericdatacenter-engineereng-managerreliability-sre
posted 3mo ago · verified today
Nscaleneocloud
Norway · manager
cluster-datacenterdatacenter-engineereng-managergpu-genericreliability-sre
posted 19d ago · verified today
Nscaleneocloud
Houston · San Francisco +1 more · $100K–$140K · unknown
gpu-genericreliability-sresrecluster-datacenternvidia
posted 3mo ago · verified today
Amazon (AWS)hyperscaler
Arlington, Virginia, USA · Denver, Colorado, USA +1 more · onsite · senior
solutions-architectkubernetes-opsscheduling-orchestrationcluster-datacentergpu-generic
posted 15d ago · verified today
Amazon (AWS)hyperscaler
Cupertino, California, USA · onsite · senior
gpu-kernelsperformance-engineertrainiumcudanvidia
posted 15d ago · verified today
Lambdaneocloud
San Jose Office (Zanker) · $105K–$140K · unknown
cluster-datacenterdatacenter-engineernetwork-fabricgpu-genericnvidia
posted 15d ago · verified today
Lambdaneocloud
Bellevue Office · San Francisco Office (Fremont St) +1 more · remote · $231K–$342K · senior
gpu-genericsolutions-architectcluster-datacenterinfiniband-opskubernetes-ops
posted 15d ago · verified today
Lambdaneocloud
Atlanta, GA - Data Center · $89K–$119K · unknown
cluster-datacenterdatacenter-engineernvidia
posted 19d ago · verified today
Amazon (AWS)hyperscaler
Boston, Massachusetts, USA · Seattle, Washington, USA +1 more · onsite · senior
gpu-kernelsinferenceinference-engineskv-cache-systemsperformance-engineer
posted 20d ago · verified today