ai-infra-jobs

AI infrastructure roles, filterable by the stack you actually work on.

Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.

932 open roles · 18 companies · last verified today

xAIfrontier lab

Palo Alto, CA · Palo Alto, California · mid

gpu-genericml-platformsoftware-engineernvidiatraining-frameworks

posted 1d ago · verified today

xAIfrontier lab

Palo Alto, CA · Palo Alto, California; Seattle, Washington +1 more · mid

network-fabricsoftware-engineergpu-genericnetwork-engineercollectives

posted 1d ago · verified today

xAIfrontier lab

Palo Alto, CA · Palo Alto, California · senior

cluster-datacentergpu-genericml-platformreliability-sresre

posted 1d ago · verified today

xAIfrontier lab

Memphis, Tennessee; Remote International · Memphis, TN · remote · manager

cluster-datacenterdatacenter-engineerreliability-sreeng-managerpre-training

posted 1d ago · verified today

xAIfrontier lab

Palo Alto, CA · Palo Alto, California · staff plus

gpu-genericpost-trainingpre-trainingsoftware-engineerresearch-engineer

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Livingston, NJ / New York, NY / Sunnyvale, CA / Bellevue, WA +2 more · mid

gpu-genericnvidiasoftware-engineercluster-datacenternetwork-fabric

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Sunnyvale, CA +1 more · staff plus

post-trainingreinforcement-learningresearch-engineergpu-generictraining-frameworks

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Bellevue, WA / Sunnyvale, CA +1 more · staff plus

scheduling-orchestrationsoftware-engineerml-platformcluster-datacentergpu-generic

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Livingston, NJ +4 more · manager

ml-platformscheduling-orchestrationnvidiapost-trainingpre-training

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · New York, NY +1 more · senior

cluster-datacenterdatacenter-engineersoftware-engineergpu-genericreliability-sre

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Dallas, TX +5 more · staff plus

storage-checkpointingcluster-datacentersoftware-engineerinferencepost-training

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Livingston, NJ +4 more · manager

eng-managerreliability-sregpu-genericml-platforminference

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Livingston, NJ +4 more · senior

gpu-genericperformance-engineercluster-datacenterml-platforminference

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Bellevue, WA / Sunnyvale, CA +1 more · senior

post-trainingreinforcement-learningresearch-engineertraining-frameworksfine-tuning

posted 1d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Bellevue, WA / Sunnyvale, CA +1 more · manager

scheduling-orchestrationcluster-datacentergpu-genericinferenceml-platform

posted 1d ago · verified today

OpenAIfrontier lab

San Francisco · $310K–$460K

ml-platformsoftware-engineercluster-datacenterpre-trainingreliability-sre

posted 6mo ago · verified today

OpenAIfrontier lab

San Francisco · $360K–$440K · senior

pre-trainingresearch-engineertraining-frameworksperformance-engineerinference-engines

posted 15mo ago · verified today

OpenAIfrontier lab

San Francisco · Seattle +1 more · remote · $257K–$327K · senior

cluster-datacenterdatacenter-engineergpu-genericdistributed-inferencefine-tuning

posted 4mo ago · verified today

OpenAIfrontier lab

San Francisco · Seattle · remote · $342K–$555K · senior

performance-engineercluster-datacentergpu-kernelsdatacenter-engineernetwork-fabric

posted 5mo ago · verified today

OpenAIfrontier lab

San Francisco · remote · $250K–$445K · mid

performance-engineergpu-kernelstraining-frameworkscollectivespre-training

posted 10mo ago · verified today

OpenAIfrontier lab

San Francisco · $230K–$490K · mid

cluster-datacenterreliability-sresoftware-engineergpu-genericpost-training

posted 6mo ago · verified today

OpenAIfrontier lab

San Francisco · remote · $266K–$445K · mid

gpu-kernelsperformance-engineercustom-asicsoftware-engineerinference

posted 4mo ago · verified today

OpenAIfrontier lab

London, UK · New York City +1 more · $230K–$385K · senior

software-engineercluster-datacenterscheduling-orchestrationml-platformtraining-frameworks

posted 14mo ago · verified today

OpenAIfrontier lab

San Francisco · $230K–$385K · mid

evaluationsoftware-engineerdistributed-inferenceinference-enginesml-platform

posted 3mo ago · verified today

OpenAIfrontier lab

London, UK · £170K–£445K · senior

pre-trainingtraining-frameworksresearch-engineergpu-genericpost-training

posted 10w ago · verified today