AI infrastructure roles, filterable by the stack you actually work on.
Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.
1297 open roles · 85 companies · last verified today
449 roles
CoreWeaveneocloud
Elk Grove - DC · Elk Grove, IL +6 more · $90K–$102K/year est. · unknown
cluster-datacenterdatacenter-engineerreliability-sresoftware-engineer
posted today · verified today
xAIfrontier lab
Memphis, TN · manager
cluster-datacentereng-managerreliability-srepython-lang
posted today · verified today
Nscaleneocloud
Houston · New York +2 more · $220K–$293K · staff plus
inferenceinference-engineskv-cache-systemspost-trainingpython-lang
posted 1d ago · verified today
TensorWaveneocloud
Remote · remote · manager
eng-managercluster-datacenternetwork-fabriccollectivesnccl-lib
posted 1d ago · verified today
Cerebraschip vendor
Canada · United States · unknown
cpp-langpython-langreliability-sresoftware-engineercustom-asic
posted 1d ago · verified today
NexGen Cloudneocloud
Finland · Finland - Remote · mid
cluster-datacenterkubernetes-opsgpu-genericreliability-srescheduling-orchestration
posted 1d ago · verified today
Matter Intelligenceai startup
San Francisco · onsite · unknown
observabilityreliability-sresoftware-engineerml-platformsre
posted 1d ago · verified today
Nscaleneocloud
Houston · New York +2 more · manager
network-engineernetwork-fabriccluster-datacenterreliability-sregpu-generic
posted 2d ago · verified today
Amazon (AWS)hyperscaler
Cupertino, California, USA · onsite · unknown
datacenter-engineercluster-datacentergpu-genericreliability-sre
posted 2d ago · verified today
OpenAIfrontier lab
San Francisco · hybrid · $266K–$500K/year · unknown
software-engineerml-platformscheduling-orchestrationevaluationgpu-generic
posted 2d ago · verified today
Anthropicfrontier lab
New York City, NY · San Francisco, CA +1 more · $405K–$485K · manager
eng-managerml-platformcluster-datacenterkubernetes-opsgpu-generic
posted 4d ago · verified today
Parasailinference provider
San Francisco · San Mateo · hybrid · unknown
cluster-datacentergpu-genericreliability-srenetwork-fabriceng-manager
posted 4d ago · verified today
DigitalOceanneocloud
DigitalOcean Seattle Office · Seattle · $167K–$209K/year est. · senior
go-langinferencekubernetes-opsgpu-genericinference-engines
posted 5d ago · verified today
Amazon (AWS)hyperscaler
Austin, Texas, USA · Cupertino, California, USA +1 more · onsite · senior
cluster-datacentergpu-genericreliability-srelinux-kernelsoftware-engineer
posted 5d ago · verified today
Ai2frontier lab
Seattle · Seattle, WA · $147K–$220K/year est. · senior
gpu-genericscheduling-orchestrationsoftware-engineergo-langinfiniband-ops
posted 3mo ago · verified today
Nscaleneocloud
Singapore · senior
cluster-datacenterdatacenter-engineernetwork-fabricobservabilitygpu-generic
posted 5d ago · verified today
Together AIneocloud
San Francisco · $250K–$300K/year est. · senior
software-engineergo-langkubernetes-opsobservabilitypython-lang
posted 5d ago · verified today
DoorDashenterprise
San Francisco · San Francisco, CA +2 more · senior
fine-tuninggpu-genericinferenceinference-enginesml-platform
posted 10w ago · verified today
Inferactinference provider
San Francisco · onsite · junior
amdcudagpu-kernelsinferenceinference-engines
posted 1d ago · verified today
Runpodneocloud
Remote - USA · remote · senior
cluster-datacentergo-langkubernetes-opslinux-kernelnetwork-fabric
posted 7d ago · verified today
Anthropicfrontier lab
San Francisco, CA · $320K–$485K · staff plus
inferenceinference-enginessoftware-engineerreliability-sre
posted 7d ago · verified today
Amazon (AWS)hyperscaler
Austin, Texas, USA · Chicago, Illinois, USA +5 more · onsite · staff plus
solutions-architectcluster-datacentercollectivesefa-fabricfsdp
posted 7d ago · verified today
Amazon (AWS)hyperscaler
Austin, Texas, USA · onsite · mid
reliability-sresretrainiumpython-lang
posted 7d ago · verified today
Scale AIai startup
Washington, DC · $214K–$267K · manager
eng-managerinferenceinference-engineskubernetes-opsreliability-sre
posted 7d ago · verified today
Amazon (AWS)hyperscaler
Austin, Texas, USA · Cupertino, California, USA +1 more · onsite · senior
cluster-datacenterdatacenter-engineergpu-genericreliability-sre
posted 7d ago · verified today
Reactorinference provider
San Francisco · onsite · unknown
gpu-generickubernetes-opsml-platformobservabilityterraform-iac
added 7d ago · verified today
Boson AIfrontier lab
Toronto · onsite · CA$125K–CA$250K/year · unknown
nvidiareliability-sresreansiblecluster-datacenter
posted 9w ago · verified today
DigitalOceanneocloud
DigitalOcean Seattle Office · Seattle · junior
go-langgpu-genericinferencepython-langsoftware-engineer
posted 3w ago · verified today
DigitalOceanneocloud
DigitalOcean Seattle Office · Seattle · manager
cluster-datacenterdatacenter-engineereng-managerreliability-sre
posted 19d ago · verified today
DigitalOceanneocloud
Bangalore Metro · Bengaluru · senior
cudakubernetes-opsnvidiaamdrocm-hip
posted 11w ago · verified today