AI infrastructure roles, filterable by the stack you actually work on.

Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.

1297 open roles · 85 companies · last verified today

35 roles

fsdp

Amazon (AWS)hyperscaler

Austin, Texas, USA · Chicago, Illinois, USA +5 more · onsite · staff plus

solutions-architectcluster-datacentercollectivesefa-fabricfsdp

posted 7d ago · verified today

Black Forest Labsfrontier lab

Freiburg (Germany) · onsite · staff plus

pre-trainingfsdppython-langpytorch-distresearch-engineer

posted 4mo ago · verified today

Luma AIai startup

Redwood City, CA · hybrid · unknown

pytorch-disttraining-frameworkscollectivescudafsdp

posted 7w ago · verified today

Hedraai startup

San Francisco · $175K–$275K/year · unknown

post-trainingpre-trainingresearch-engineerdeepspeed-libfsdp

posted 5mo ago · verified today

Figureai startup

HQ · San Jose, CA · $200K–$400K/year est. · senior

performance-engineercollectivescpp-langcudafsdp

posted 4w ago · verified today

1Xai startup

San Carlos, CA · onsite · $250K–$350K/year · unknown

gpu-genericpre-trainingpython-langresearch-engineertraining-data-infra

posted 3mo ago · verified today

Lightning AIai startup

London, UK · New York, New York +6 more · remote · $165K–$310K · senior

python-langresearch-engineertraining-frameworksevaluationfine-tuning

posted 5w ago · verified today

Lightning AIai startup

London, England, United Kingdom · London, UK +6 more · remote · $165K–$310K · unknown

post-trainingresearch-engineercudatraining-frameworksdeepspeed-lib

posted 26mo ago · verified today

RadixArkai startup

Palo Alto, CA · Palo Alto Office · $200K–$400K/year est. · unknown

gpu-genericpost-traininggpu-kernelsmodel-parallelismtraining-frameworks

posted 7mo ago · verified today

Prime Intellectneocloud

Remote · San Francisco · unknown

cudadeepspeed-libfsdpgpu-kernelsmodel-parallelism

posted 10w ago · verified today

Periodic Labsfrontier lab

Menlo Park, CA · onsite · unknown

collectivescudacutlass-cutefsdpgpu-generic

posted 4mo ago · verified today

Mistral AIfrontier lab

Amsterdam · Lausanne +3 more · hybrid · unknown

post-trainingreinforcement-learningresearch-engineerevaluationfine-tuning

posted 12d ago · verified today

CoreWeaveneocloud

Bellevue, WA · San Francisco, CA +1 more · $198K–$264K/year est. · staff plus

amdcluster-datacenterdeepspeed-libdistributed-inferencefsdp

posted 4w ago · verified today

Amazon (AWS)hyperscaler

Cupertino, California, USA · onsite · manager

eng-managertrainiumdeepspeed-libfsdpmodel-parallelism

posted 3mo ago · verified today

Amazon (AWS)hyperscaler

Bellevue, Washington, USA · onsite · mid

software-engineerml-platformtrainiumscheduling-orchestrationfsdp

posted 6w ago · verified today

Baseteninference provider

New York · San Francisco · hybrid · $165K–$330K/year · unknown

ml-platformsoftware-engineerfine-tuningkubernetes-opspost-training

posted 7mo ago · verified today

Baseteninference provider

New York · San Francisco · hybrid · $165K–$330K/year · unknown

go-langkubernetes-opsml-platformsoftware-engineerobservability

posted 12mo ago · verified today

Fireworks AIinference provider

New York · San Mateo · hybrid · $210K–$320K/year · unknown

software-engineertraining-frameworksfsdpkubernetes-opsml-platform

posted 6w ago · verified today

CoreWeaveneocloud

Bellevue, WA · Sunnyvale, CA · $206K–$333K/year est. · staff plus

cudaperformance-engineergpu-genericinferenceinference-engines

posted 9mo ago · verified today