AI infrastructure roles, filterable by the stack you actually work on.
Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.
1297 open roles · 85 companies · last verified today
96 roles
xAIfrontier lab
Palo Alto, CA · $150K–$250K/year est. · unknown
network-engineernetwork-fabriccluster-datacentergpu-genericroce-net
posted 2d ago · verified today
Together AIneocloud
Bangalore India · Remote · staff plus
ansiblego-langkubernetes-opsobject-storageobservability
posted 5d ago · verified today
Cerebraschip vendor
Sunnyvale, CA · Toronto, CAN · hybrid · unknown
software-engineernetwork-fabricrdma-verbsroce-net
posted 6d ago · verified today
Inferactinference provider
San Francisco · onsite · junior
amdcudagpu-kernelsinferenceinference-engines
posted 1d ago · verified today
Amazon (AWS)hyperscaler
Haifa, Haifa, ISR · onsite · mid
cpp-langefa-fabriclinux-kernelnetwork-fabricrdma-verbs
posted 7d ago · verified today
DigitalOceanneocloud
Bangalore Metro · Bengaluru · senior
cudakubernetes-opsnvidiaamdrocm-hip
posted 11w ago · verified today
Fireworks AIinference provider
New York · San Mateo · hybrid · $200K–$230K/year · unknown
scheduling-orchestrationcpp-langnetwork-fabricpython-langstorage-checkpointing
posted 8d ago · verified today
Nscaleneocloud
Houston · New York +2 more · $130K–$200K/year est. · mid
reliability-sresrego-langobservabilitypython-lang
posted 8d ago · verified today
Nscaleneocloud
Houston · San Francisco +1 more · $170K–$265K · senior
reliability-sresrego-langkubernetes-opsobservability
posted 5mo ago · verified today
Cerebraschip vendor
Toronto, CAN · hybrid · senior
cluster-datacentergo-langkubernetes-opsscheduling-orchestrationobservability
posted 8d ago · verified today
Luma AIai startup
Redwood City, CA · hybrid · $168K–$252K/year · senior
reliability-sresregpu-genericnvidiaamd
posted 7w ago · verified today
Figureai startup
HQ · San Jose, CA · $200K–$400K/year est. · senior
performance-engineercollectivescpp-langcudafsdp
posted 4w ago · verified today
Lightning AIai startup
New York, New York · New York, New York, United States +5 more · remote · $170K–$210K · senior
infiniband-opsnetwork-engineernetwork-fabricnvidiaansible
posted 8w ago · verified today
Lightning AIai startup
London, England, United Kingdom · London, UK +7 more · remote · $180K–$220K · senior
object-storagepython-langstorage-checkpointingsoftware-engineercluster-datacenter
posted 4mo ago · verified today
Lightning AIai startup
New York, New York, United States · San Francisco, California +3 more · $115K–$140K · unknown
cudagpu-generickubernetes-opsnccl-libobservability
posted 3mo ago · verified today
Lightning AIai startup
London, England, United Kingdom · London, UK · £75K–£95K · unknown
cudagpu-generickubernetes-opsml-platformnccl-lib
posted 3mo ago · verified today
Lightning AIai startup
Philippines · Remote +1 more · unknown
reliability-sresrecluster-datacentergpu-generickubernetes-ops
posted 4mo ago · verified today
Etchedchip vendor
San Jose · onsite · manager
cluster-datacentereng-managerinferenceinference-enginesnetwork-fabric
posted 5mo ago · verified today
Coherefrontier lab
Canada · United States · hybrid · senior
cluster-datacentergo-langgpu-generickubernetes-opsnccl-lib
posted 13d ago · verified today
Reflection AIfrontier lab
London · New York, NY +1 more · onsite · unknown
pytorch-distreinforcement-learningsoftware-engineertraining-frameworkscollectives
posted 6mo ago · verified today
RadixArkai startup
Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · unknown
gpu-genericpost-traininggpu-kernelsmodel-parallelismtraining-frameworks
posted 7mo ago · verified today
RadixArkai startup
Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · senior
cpp-langcudagpu-kernelsperformance-engineercollectives
posted 7mo ago · verified today
RadixArkai startup
Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · senior
cluster-datacenterscheduling-orchestrationgpu-generickubernetes-opsnetwork-fabric
posted 7mo ago · verified today
falinference provider
San Francisco · $180K–$250K/year · mid
ansiblecudanvidiaobservabilitypython-lang
posted 6mo ago · verified today
falinference provider
Remote - Global · unknown
python-langgpu-genericcudanvidiareliability-sre
posted 6mo ago · verified today
Inferactinference provider
San Francisco · onsite · $200K–$400K/year · unknown
cluster-datacentergpu-genericreliability-sreansiblekubernetes-ops
posted 3w ago · verified today
FriendliAIinference provider
San Francisco · hybrid · senior
cluster-datacentergpu-genericinferencekubernetes-opsml-platform
posted 5w ago · verified today
FriendliAIinference provider
Seoul · onsite · senior
kubernetes-opssoftware-engineernetwork-fabricscheduling-orchestrationcluster-datacenter
posted 5w ago · verified today
TensorWaveneocloud
Las Vegas, Nevada · onsite · mid
amdgpu-generickubernetes-opsreliability-srescheduling-orchestration
posted 3w ago · verified today
TensorWaveneocloud
Las Vegas, Nevada · Remote · remote · senior
ansiblecudakubernetes-opsnetwork-fabricpython-lang
posted 7w ago · verified today