AI infrastructure roles, filterable by the stack you actually work on.
Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.
1297 open roles · 85 companies · last verified today
118 roles
TensorWaveneocloud
Remote · remote · manager
eng-managercluster-datacenternetwork-fabriccollectivesnccl-lib
posted 1d ago · verified today
Radiantneocloud
UK · staff plus
kubernetes-opsansiblecluster-datacentergo-langgpu-virtualization
posted 1d ago · verified today
Nscaleneocloud
Houston · New York +2 more · manager
network-engineernetwork-fabriccluster-datacenterreliability-sregpu-generic
posted 2d ago · verified today
xAIfrontier lab
Palo Alto, CA · $150K–$250K/year est. · unknown
network-engineernetwork-fabriccluster-datacentergpu-genericroce-net
posted 2d ago · verified today
xAIfrontier lab
Dublin · Dublin, Ireland · $100K–$150K/year est. · unknown
network-engineeransiblecluster-datacenternetwork-fabricpython-lang
posted 2d ago · verified today
Together AIneocloud
Bangalore India · Remote · staff plus
ansiblego-langkubernetes-opsobject-storageobservability
posted 5d ago · verified today
Boson AIfrontier lab
Toronto · onsite · CA$125K–CA$250K/year · unknown
nvidiareliability-sresreansiblecluster-datacenter
posted 9w ago · verified today
DigitalOceanneocloud
Bay Area Metro · New York · $150K–$186K/year est. · senior
solutions-architectcudagpu-genericinferencekubernetes-ops
posted 5mo ago · verified today
DigitalOceanneocloud
Bay Area Metro · San Francisco · $150K–$215K/year est. · senior
cudakubernetes-opssolutions-architectfine-tuninggpu-generic
posted 5mo ago · verified today
DigitalOceanneocloud
Bangalore Metro · Bengaluru · senior
cudakubernetes-opsnvidiaamdrocm-hip
posted 11w ago · verified today
Nebiusneocloud
Abu Dhabi, UAE · Dubai +1 more · senior
solutions-architectansiblecudagpu-generickubernetes-ops
posted 9d ago · verified today
Nscaleneocloud
UK · manager
eng-manageransiblecluster-datacentergpu-genericobservability
posted 9d ago · verified today
Xaira Therapeuticsai startup
Seattle, WA · Seattle, Washington, United States · $185K–$226K/year est. · senior
evaluationml-platformpython-langscheduling-orchestrationsoftware-engineer
posted 3mo ago · verified today
Abridgeai startup
SF Office · hybrid · $221K–$260K/year · senior
inferenceinference-engineskubernetes-opssoftware-engineercuda
posted 12mo ago · verified today
ElevenLabsai startup
United States · remote · unknown
gpu-genericnvidiacluster-datacentercudareliability-sre
posted 13d ago · verified today
Lightning AIai startup
New York, New York · New York, New York, United States +5 more · remote · $170K–$210K · senior
infiniband-opsnetwork-engineernetwork-fabricnvidiaansible
posted 8w ago · verified today
Lightning AIai startup
Remote · remote · $150K–$190K · senior
network-engineernetwork-fabricpython-langroce-netansible
posted 3mo ago · verified today
Lightning AIai startup
Singapore · 165K–205K SGD · senior
reliability-sresreansiblecluster-datacenterkubernetes-ops
posted 7w ago · verified today
Lightning AIai startup
London, England, United Kingdom · London, UK +7 more · remote · $160K–$200K · senior
reliability-sresreansiblecluster-datacenterkubernetes-ops
posted 3mo ago · verified today
Etchedchip vendor
San Jose · onsite · $130K–$210K/year · unknown
cluster-datacenterdatacenter-engineernetwork-engineernetwork-fabricansible
posted 11w ago · verified today
Etchedchip vendor
San Jose · onsite · $150K–$275K/year · unknown
kubernetes-opsobservabilitypython-langslurm-adminsoftware-engineer
posted 6mo ago · verified today
falinference provider
Remote - USA · remote · $180K–$250K/year · senior
gpu-generickubernetes-opssoftware-engineercluster-datacentergpu-virtualization
posted 4w ago · verified today
falinference provider
San Francisco · $180K–$250K/year · mid
ansiblecudanvidiaobservabilitypython-lang
posted 6mo ago · verified today
falinference provider
Remote - Global · unknown
python-langgpu-genericcudanvidiareliability-sre
posted 6mo ago · verified today
Inferactinference provider
San Francisco · onsite · $200K–$400K/year · unknown
cluster-datacentergpu-genericreliability-sreansiblekubernetes-ops
posted 3w ago · verified today
FriendliAIinference provider
San Francisco · hybrid · senior
cluster-datacentergpu-genericinferencekubernetes-opsml-platform
posted 5w ago · verified today
FriendliAIinference provider
Seoul · onsite · senior
kubernetes-opssoftware-engineernetwork-fabricscheduling-orchestrationcluster-datacenter
posted 5w ago · verified today
Prime Intellectneocloud
San Francisco · onsite · unknown
kubernetes-opsml-platformfine-tuninggpu-genericnvidia
posted 10w ago · verified today
Prime Intellectneocloud
Remote · San Francisco · hybrid · unknown
cluster-datacentergpu-genericinfiniband-opskubernetes-opsnetwork-fabric
posted 10w ago · verified today
Prime Intellectneocloud
San Francisco · unknown
python-langsoftware-engineercluster-datacentergpu-generickubernetes-ops
posted 10w ago · verified today