AI infrastructure roles, filterable by the stack you actually work on.

Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.

1297 open roles · 85 companies · last verified today

118 roles

ansible

Nscaleneocloud

Houston · New York +2 more · manager

network-engineernetwork-fabriccluster-datacenterreliability-sregpu-generic

posted 2d ago · verified today

xAIfrontier lab

Palo Alto, CA · $150K–$250K/year est. · unknown

network-engineernetwork-fabriccluster-datacentergpu-genericroce-net

posted 2d ago · verified today

xAIfrontier lab

Dublin · Dublin, Ireland · $100K–$150K/year est. · unknown

network-engineeransiblecluster-datacenternetwork-fabricpython-lang

posted 2d ago · verified today

Boson AIfrontier lab

Toronto · onsite · CA$125K–CA$250K/year · unknown

nvidiareliability-sresreansiblecluster-datacenter

posted 9w ago · verified today

DigitalOceanneocloud

Bay Area Metro · New York · $150K–$186K/year est. · senior

solutions-architectcudagpu-genericinferencekubernetes-ops

posted 5mo ago · verified today

DigitalOceanneocloud

Bay Area Metro · San Francisco · $150K–$215K/year est. · senior

cudakubernetes-opssolutions-architectfine-tuninggpu-generic

posted 5mo ago · verified today

DigitalOceanneocloud

Bangalore Metro · Bengaluru · senior

cudakubernetes-opsnvidiaamdrocm-hip

posted 11w ago · verified today

Nebiusneocloud

Abu Dhabi, UAE · Dubai +1 more · senior

solutions-architectansiblecudagpu-generickubernetes-ops

posted 9d ago · verified today

Xaira Therapeuticsai startup

Seattle, WA · Seattle, Washington, United States · $185K–$226K/year est. · senior

evaluationml-platformpython-langscheduling-orchestrationsoftware-engineer

posted 3mo ago · verified today

Abridgeai startup

SF Office · hybrid · $221K–$260K/year · senior

inferenceinference-engineskubernetes-opssoftware-engineercuda

posted 12mo ago · verified today

ElevenLabsai startup

United States · remote · unknown

gpu-genericnvidiacluster-datacentercudareliability-sre

posted 13d ago · verified today

Lightning AIai startup

New York, New York · New York, New York, United States +5 more · remote · $170K–$210K · senior

infiniband-opsnetwork-engineernetwork-fabricnvidiaansible

posted 8w ago · verified today

Lightning AIai startup

Remote · remote · $150K–$190K · senior

network-engineernetwork-fabricpython-langroce-netansible

posted 3mo ago · verified today

Lightning AIai startup

Singapore · 165K–205K SGD · senior

reliability-sresreansiblecluster-datacenterkubernetes-ops

posted 7w ago · verified today

Lightning AIai startup

London, England, United Kingdom · London, UK +7 more · remote · $160K–$200K · senior

reliability-sresreansiblecluster-datacenterkubernetes-ops

posted 3mo ago · verified today

Etchedchip vendor

San Jose · onsite · $130K–$210K/year · unknown

cluster-datacenterdatacenter-engineernetwork-engineernetwork-fabricansible

posted 11w ago · verified today

Etchedchip vendor

San Jose · onsite · $150K–$275K/year · unknown

kubernetes-opsobservabilitypython-langslurm-adminsoftware-engineer

posted 6mo ago · verified today

falinference provider

Remote - USA · remote · $180K–$250K/year · senior

gpu-generickubernetes-opssoftware-engineercluster-datacentergpu-virtualization

posted 4w ago · verified today

falinference provider

San Francisco · $180K–$250K/year · mid

ansiblecudanvidiaobservabilitypython-lang

posted 6mo ago · verified today

falinference provider

Remote - Global · unknown

python-langgpu-genericcudanvidiareliability-sre

posted 6mo ago · verified today

Inferactinference provider

San Francisco · onsite · $200K–$400K/year · unknown

cluster-datacentergpu-genericreliability-sreansiblekubernetes-ops

posted 3w ago · verified today

FriendliAIinference provider

San Francisco · hybrid · senior

cluster-datacentergpu-genericinferencekubernetes-opsml-platform

posted 5w ago · verified today