AI infrastructure roles, filterable by the stack you actually work on.

Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.

1297 open roles · 85 companies · last verified today

96 roles

rdma-verbs

xAIfrontier lab

Palo Alto, CA · $150K–$250K/year est. · unknown

network-engineernetwork-fabriccluster-datacentergpu-genericroce-net

posted 2d ago · verified today

Cerebraschip vendor

Sunnyvale, CA · Toronto, CAN · hybrid · unknown

software-engineernetwork-fabricrdma-verbsroce-net

posted 6d ago · verified today

Inferactinference provider

San Francisco · onsite · junior

amdcudagpu-kernelsinferenceinference-engines

posted 1d ago · verified today

Amazon (AWS)hyperscaler

Haifa, Haifa, ISR · onsite · mid

cpp-langefa-fabriclinux-kernelnetwork-fabricrdma-verbs

posted 7d ago · verified today

DigitalOceanneocloud

Bangalore Metro · Bengaluru · senior

cudakubernetes-opsnvidiaamdrocm-hip

posted 11w ago · verified today

Fireworks AIinference provider

New York · San Mateo · hybrid · $200K–$230K/year · unknown

scheduling-orchestrationcpp-langnetwork-fabricpython-langstorage-checkpointing

posted 8d ago · verified today

Nscaleneocloud

Houston · New York +2 more · $130K–$200K/year est. · mid

reliability-sresrego-langobservabilitypython-lang

posted 8d ago · verified today

Nscaleneocloud

Houston · San Francisco +1 more · $170K–$265K · senior

reliability-sresrego-langkubernetes-opsobservability

posted 5mo ago · verified today

Luma AIai startup

Redwood City, CA · hybrid · $168K–$252K/year · senior

reliability-sresregpu-genericnvidiaamd

posted 7w ago · verified today

Figureai startup

HQ · San Jose, CA · $200K–$400K/year est. · senior

performance-engineercollectivescpp-langcudafsdp

posted 4w ago · verified today

Lightning AIai startup

New York, New York · New York, New York, United States +5 more · remote · $170K–$210K · senior

infiniband-opsnetwork-engineernetwork-fabricnvidiaansible

posted 8w ago · verified today

Lightning AIai startup

London, England, United Kingdom · London, UK +7 more · remote · $180K–$220K · senior

object-storagepython-langstorage-checkpointingsoftware-engineercluster-datacenter

posted 4mo ago · verified today

Lightning AIai startup

New York, New York, United States · San Francisco, California +3 more · $115K–$140K · unknown

cudagpu-generickubernetes-opsnccl-libobservability

posted 3mo ago · verified today

Lightning AIai startup

London, England, United Kingdom · London, UK · £75K–£95K · unknown

cudagpu-generickubernetes-opsml-platformnccl-lib

posted 3mo ago · verified today

Lightning AIai startup

Philippines · Remote +1 more · unknown

reliability-sresrecluster-datacentergpu-generickubernetes-ops

posted 4mo ago · verified today

Etchedchip vendor

San Jose · onsite · manager

cluster-datacentereng-managerinferenceinference-enginesnetwork-fabric

posted 5mo ago · verified today

Coherefrontier lab

Canada · United States · hybrid · senior

cluster-datacentergo-langgpu-generickubernetes-opsnccl-lib

posted 13d ago · verified today

RadixArkai startup

Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · unknown

gpu-genericpost-traininggpu-kernelsmodel-parallelismtraining-frameworks

posted 7mo ago · verified today

RadixArkai startup

Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · senior

cpp-langcudagpu-kernelsperformance-engineercollectives

posted 7mo ago · verified today

RadixArkai startup

Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · senior

cluster-datacenterscheduling-orchestrationgpu-generickubernetes-opsnetwork-fabric

posted 7mo ago · verified today

falinference provider

San Francisco · $180K–$250K/year · mid

ansiblecudanvidiaobservabilitypython-lang

posted 6mo ago · verified today

falinference provider

Remote - Global · unknown

python-langgpu-genericcudanvidiareliability-sre

posted 6mo ago · verified today

Inferactinference provider

San Francisco · onsite · $200K–$400K/year · unknown

cluster-datacentergpu-genericreliability-sreansiblekubernetes-ops

posted 3w ago · verified today

FriendliAIinference provider

San Francisco · hybrid · senior

cluster-datacentergpu-genericinferencekubernetes-opsml-platform

posted 5w ago · verified today

TensorWaveneocloud

Las Vegas, Nevada · onsite · mid

amdgpu-generickubernetes-opsreliability-srescheduling-orchestration

posted 3w ago · verified today

TensorWaveneocloud

Las Vegas, Nevada · Remote · remote · senior

ansiblecudakubernetes-opsnetwork-fabricpython-lang

posted 7w ago · verified today