AI infrastructure roles, filterable by the stack you actually work on.
Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.
1297 open roles · 85 companies · last verified today
57 roles
Amazon (AWS)hyperscaler
Austin, Texas, USA · Dallas, Texas, USA +2 more · onsite · staff plus
cluster-datacentercollectivesdeepspeed-libdistributed-inferenceefa-fabric
posted 7w ago · verified today
DigitalOceanneocloud
Bay Area Metro · Seattle · $220K–$239K/year est. · staff plus
amdcudainferencekubernetes-opsnvidia
posted 4mo ago · verified today
DigitalOceanneocloud
Bay Area Metro · San Francisco · $220K–$239K/year est. · staff plus
amdcudadistributed-inferencego-langinference
posted 4mo ago · verified today
DigitalOceanneocloud
Bangalore Metro · Bengaluru · senior
cudakubernetes-opsnvidiaamdrocm-hip
posted 11w ago · verified today
DeepInfrainference provider
Palo Alto, United States · onsite · unknown
inferenceinference-enginesnvidiapython-langsolutions-architect
posted 4w ago · verified today
Luma AIai startup
Redwood City, CA · hybrid · unknown
inferenceinference-enginessoftware-engineerkubernetes-opspython-lang
posted 7w ago · verified today
Figureai startup
HQ · San Jose, CA · $200K–$400K/year est. · senior
performance-engineercollectivescpp-langcudafsdp
posted 4w ago · verified today
Tenstorrentchip vendor
Tokyo · Tokyo, Japan · unknown
cluster-datacenterdatacenter-engineergpu-genericreliability-srenetwork-fabric
posted 12mo ago · verified today
Tenstorrentchip vendor
Santa Clara · Santa Clara, California, United States · $100K–$500K/year est. · unknown
network-engineernetwork-fabricrtl-designcluster-datacenterinfiniband-ops
posted 6mo ago · verified today
Generalistai startup
San Francisco Bay Area (San Mateo) or Boston (Somerville) · onsite · $260K–$350K/year · unknown
cudagpu-kernelspython-langgpu-genericnvlink-topology
posted 7mo ago · verified today
Lightning AIai startup
London, England, United Kingdom · London, UK +7 more · remote · $180K–$220K · unknown
cluster-datacenterdatacenter-engineergpu-genericnvidiapython-lang
posted 4mo ago · verified today
Etchedchip vendor
San Jose · onsite · junior
cpp-langinferencepython-langdistributed-inferencecollectives
posted 9mo ago · verified today
RadixArkai startup
Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · unknown
gpu-genericpost-traininggpu-kernelsmodel-parallelismtraining-frameworks
posted 7mo ago · verified today
RadixArkai startup
Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · senior
cpp-langcudagpu-kernelsperformance-engineercollectives
posted 7mo ago · verified today
falinference provider
Remote - USA · remote · $180K–$250K/year · senior
gpu-generickubernetes-opssoftware-engineercluster-datacentergpu-virtualization
posted 4w ago · verified today
falinference provider
San Francisco · $180K–$250K/year · mid
ansiblecudanvidiaobservabilitypython-lang
posted 6mo ago · verified today
falinference provider
Remote - Global · unknown
python-langgpu-genericcudanvidiareliability-sre
posted 6mo ago · verified today
Inferactinference provider
San Francisco · onsite · $200K–$400K/year · unknown
cluster-datacentergpu-genericreliability-sreansiblekubernetes-ops
posted 3w ago · verified today
Inferactinference provider
Singapore · onsite · 200K–400K SGD/year · unknown
software-engineerdistributed-inferenceinference-enginesinfiniband-opsnvlink-topology
posted 12w ago · verified today
Inferactinference provider
San Francisco · onsite · $200K–$400K/year · unknown
distributed-inferenceinference-enginesvllm-enginecpp-langgo-lang
posted 7mo ago · verified today
NexGen Cloudneocloud
UK - Remote · remote · senior
cudanvidiacluster-datacenternetwork-fabriccudnn-lib
posted 4mo ago · verified today
Prime Intellectneocloud
San Francisco · onsite · unknown
kubernetes-opsml-platformfine-tuninggpu-genericnvidia
posted 10w ago · verified today
Prime Intellectneocloud
Remote · San Francisco · hybrid · unknown
cluster-datacentergpu-genericinfiniband-opskubernetes-opsnetwork-fabric
posted 10w ago · verified today
Runpodneocloud
Remote - USA · remote · manager
eng-manageransiblecluster-datacentergpu-genericinfiniband-ops
posted 9w ago · verified today
Periodic Labsfrontier lab
Menlo Park, CA · onsite · unknown
collectivescudacutlass-cutefsdpgpu-generic
posted 4mo ago · verified today
Thinking Machines Labfrontier lab
San Francisco · hybrid · unknown
cluster-datacenterreliability-sresregpu-generickubernetes-ops
posted 11w ago · verified today
Nscaleneocloud
Austin, TX · Houston +3 more · staff plus
ansiblecluster-datacentercollectivescpp-langdeepspeed-lib
posted 13d ago · verified today
Nscaleneocloud
Houston · New York +2 more · staff plus
nvidiasoftware-engineercluster-datacentercudago-lang
posted 4w ago · verified today
Nscaleneocloud
Houston · San Francisco +1 more · $120K–$170K · senior
nvidiasrecluster-datacenterinfiniband-opsnccl-lib
posted 6mo ago · verified today
Nscaleneocloud
Houston · San Francisco +1 more · $100K–$140K · unknown
gpu-genericreliability-sresrecluster-datacenternvidia
posted 3mo ago · verified today