AI infrastructure roles, filterable by the stack you actually work on.

Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.

1297 open roles · 85 companies · last verified today

128 roles

roce-net

Nscaleneocloud

Houston · New York +2 more · $160K–$290K · senior

infiniband-opsnetwork-fabricroce-netsolutions-architectcluster-datacenter

posted 1d ago · verified today

xAIfrontier lab

Palo Alto, CA · $150K–$250K/year est. · unknown

network-engineernetwork-fabriccluster-datacentergpu-genericroce-net

posted 2d ago · verified today

xAIfrontier lab

Dublin · Dublin, Ireland · $100K–$150K/year est. · unknown

network-engineeransiblecluster-datacenternetwork-fabricpython-lang

posted 2d ago · verified today

Cerebraschip vendor

Sunnyvale, CA · Toronto, CAN · hybrid · unknown

software-engineernetwork-fabricrdma-verbsroce-net

posted 6d ago · verified today

Runpodneocloud

Remote - USA · remote · senior

cluster-datacentergo-langkubernetes-opslinux-kernelnetwork-fabric

posted 7d ago · verified today

Boson AIfrontier lab

Toronto · onsite · CA$125K–CA$250K/year · unknown

nvidiareliability-sresreansiblecluster-datacenter

posted 9w ago · verified today

DigitalOceanneocloud

Bay Area Metro · Seattle · $220K–$239K/year est. · staff plus

amdcudainferencekubernetes-opsnvidia

posted 4mo ago · verified today

DigitalOceanneocloud

Bay Area Metro · San Francisco · $220K–$239K/year est. · staff plus

amdcudadistributed-inferencego-langinference

posted 4mo ago · verified today

DigitalOceanneocloud

Bangalore Metro · Bengaluru · senior

cudakubernetes-opsnvidiaamdrocm-hip

posted 11w ago · verified today

Fish Audio (39 AI)ai startup

Location not specified · senior

cluster-datacentergpu-genericreliability-sresrekubernetes-ops

added 7d ago · verified today

Fireworks AIinference provider

New York · San Mateo · hybrid · $200K–$230K/year · unknown

scheduling-orchestrationcpp-langnetwork-fabricpython-langstorage-checkpointing

posted 7d ago · verified today

Luma AIai startup

Redwood City, CA · hybrid · unknown

inferenceinference-enginessoftware-engineerkubernetes-opspython-lang

posted 7w ago · verified today

Luma AIai startup

Redwood City, CA · hybrid · $168K–$252K/year · senior

reliability-sresregpu-genericnvidiaamd

posted 7w ago · verified today

ElevenLabsai startup

United States · remote · unknown

gpu-genericnvidiacluster-datacentercudareliability-sre

posted 13d ago · verified today

Cursorai startup

New York · San Francisco · onsite · unknown

go-langkubernetes-opsnvidiapython-langsoftware-engineer

posted 7mo ago · verified today

Figureai startup

HQ · San Jose, CA · $200K–$400K/year est. · senior

performance-engineercollectivescpp-langcudafsdp

posted 4w ago · verified today

Tenstorrentchip vendor

Santa Clara · Santa Clara, California, United States · $100K–$500K/year est. · unknown

network-engineernetwork-fabricrtl-designcluster-datacenterinfiniband-ops

posted 6mo ago · verified today

Lightning AIai startup

New York, New York · New York, New York, United States +5 more · remote · $170K–$210K · senior

infiniband-opsnetwork-engineernetwork-fabricnvidiaansible

posted 8w ago · verified today

Lightning AIai startup

Remote · remote · $150K–$190K · senior

network-engineernetwork-fabricpython-langroce-netansible

posted 3mo ago · verified today

falinference provider

Remote - USA · remote · $180K–$250K/year · senior

gpu-generickubernetes-opssoftware-engineercluster-datacentergpu-virtualization

posted 4w ago · verified today

falinference provider

San Francisco · $180K–$250K/year · mid

ansiblecudanvidiaobservabilitypython-lang

posted 6mo ago · verified today

falinference provider

Remote - Global · unknown

python-langgpu-genericcudanvidiareliability-sre

posted 6mo ago · verified today

Inferactinference provider

San Francisco · onsite · $200K–$400K/year · unknown

cluster-datacentergpu-genericreliability-sreansiblekubernetes-ops

posted 3w ago · verified today

Inferactinference provider

Singapore · onsite · 200K–400K SGD/year · unknown

software-engineerdistributed-inferenceinference-enginesinfiniband-opsnvlink-topology

posted 12w ago · verified today

Inferactinference provider

San Francisco · onsite · $200K–$400K/year · unknown

distributed-inferenceinference-enginesvllm-enginecpp-langgo-lang

posted 7mo ago · verified today

FriendliAIinference provider

San Francisco · hybrid · senior

cluster-datacentergpu-genericinferencekubernetes-opsml-platform

posted 5w ago · verified today

San Francisco Compute Companyneocloud

Remote · San Francisco, CA · hybrid · $220K–$300K/year · senior

cluster-datacenterdatacenter-engineergpu-genericnetwork-fabricinfiniband-ops

posted 1d ago · verified today