AI infrastructure roles, filterable by the stack you actually work on.

Distributed training · inference serving · GPU fleets · network fabric — aggregated straight from company boards, never a copy of a copy.

1296 open roles · 85 companies · last verified today

274 roles

go-lang

Inferactinference provider

Remote · remote · $200K–$400K/year · unknown

go-langkubernetes-opspython-langrust-langterraform-iac

posted 3w ago · verified today

Inferactinference provider

San Francisco · onsite · $200K–$400K/year · unknown

reliability-sresreinferenceobservabilityvllm-engine

posted 3w ago · verified today

Inferactinference provider

Singapore · onsite · 200K–400K SGD/year · unknown

software-engineerdistributed-inferenceinference-enginesinfiniband-opsnvlink-topology

posted 12w ago · verified today

Inferactinference provider

Singapore · onsite · 200K–400K SGD/year · unknown

cluster-datacentergo-langgpu-genericinferencekubernetes-ops

posted 12w ago · verified today

Inferactinference provider

San Francisco · onsite · $200K–$400K/year · unknown

kubernetes-opssoftware-engineercluster-datacentergo-langinference

posted 7mo ago · verified today

Inferactinference provider

San Francisco · onsite · $200K–$400K/year · unknown

distributed-inferenceinference-enginesvllm-enginecpp-langgo-lang

posted 7mo ago · verified today

FriendliAIinference provider

San Francisco · hybrid · senior

cluster-datacentergpu-genericinferencekubernetes-opsml-platform

posted 5w ago · verified today

Runpodneocloud

Remote - USA · remote · senior

go-langsoftware-engineercluster-datacenter

posted 23mo ago · verified today

Runpodneocloud

Remote - USA · remote · senior

observabilityreliability-sresrego-langpython-lang

posted 9w ago · verified today

TensorWaveneocloud

Las Vegas, Nevada · onsite · mid

amdgpu-generickubernetes-opsreliability-srescheduling-orchestration

posted 3w ago · verified today

TensorWaveneocloud

Las Vegas, Nevada · Remote · remote · manager

network-fabricpython-langsoftware-engineerobservabilityeng-manager

posted 5w ago · verified today

TensorWaveneocloud

Las Vegas, Nevada · Remote · onsite · senior

gpu-generickubernetes-opsml-platformpython-langscheduling-orchestration

posted 10mo ago · verified today

Thinking Machines Labfrontier lab

New York · San Francisco · onsite · unknown

post-trainingreliability-sresrepython-langreinforcement-learning

posted 15d ago · verified today

Mistral AIfrontier lab

Palo Alto · hybrid · unknown

ml-platformscheduling-orchestrationkubernetes-opspython-langcuda

posted 13d ago · verified today

CoreWeaveneocloud

Bellevue, WA · Livingston, NJ +1 more · $153K–$204K/year est. · senior

kubernetes-opssoftware-engineercpp-langgo-langgpu-generic

posted 13d ago · verified today

xAIfrontier lab

Memphis, TN · Southaven, MS · senior

reliability-sresrecluster-datacenterobservabilitypython-lang

posted 14d ago · verified today

Nscaleneocloud

US · $190K–$260K · staff plus

observabilitygo-langgpu-generickubernetes-opspython-lang

posted 3mo ago · verified today

Nscaleneocloud

Houston · New York +2 more · staff plus

nvidiasoftware-engineercluster-datacentercudago-lang

posted 4w ago · verified today

Nscaleneocloud

New York · $225K–$275K · staff plus

scheduling-orchestrationslurm-adminsoftware-engineergo-langpython-lang

posted 3mo ago · verified today

Nscaleneocloud

Houston · San Francisco +1 more · $220K–$265K · staff plus

kubernetes-opsgo-langobservabilitysoftware-engineerebpf

posted 20d ago · verified today

Nscaleneocloud

US · $160K–$230K · senior

observabilitygo-langkubernetes-opspython-langansible

posted 3w ago · verified today