Director of Platform Engineering
at First Due · 101-250 employees
- Seniority
- Director Plus
- Work model
- Remote
- Location
- Remote - US Only
- Posted
- 5d ago
at First Due · 101-250 employees
First Due provides a cloud-based SaaS platform for fire and EMS agencies consolidating pre-incident planning, mobile response, ePCR, NEMSIS-compliant reporting, scheduling, inspections, asset management, analytics, and community engagement.
<div class="content-intro"><p><strong>About First Due</strong></p> <p>First Due’s mission is to prevent first responder injury or death by providing fire and EMS agencies with transformative, end-to-end software solutions that empower them to run safer, smarter, and more effective operations.</p></div><h3><strong>Job Title: Director of Platform Engineering</strong></h3> <p><strong>Location</strong>: Remote - US Only<br><strong>Country</strong>: United States<br><strong>Department</strong>: Engineering<br><strong>Reports To</strong>: SVP, Engineering<br><strong>Position Type</strong>: Full-Time<br><strong>Salary</strong>: $240,000</p> <hr> <h3><strong>Job Summary:</strong></h3> <p><span class="TextRun SCXW221669664 BCX0" lang="EN-US" data-contrast="auto"><span class="NormalTextRun SCXW221669664 BCX0">This is a new, dedicated leadership role reporting to the SVP of Engineering, accountable for turning First Due's DevOps, SRE, database reliability, incident-management, and developer-experience practices from distributed and ad hoc into centralized and disciplined. The right leader brings genuine hands-on technical depth to build and run this function, and the executive presence to </span><span class="NormalTextRun SCXW221669664 BCX0">represent</span><span class="NormalTextRun SCXW221669664 BCX0"> platform reliability and operational maturity to the ELT.</span></span><span class="EOP Selected SCXW221669664 BCX0" data-ccp-props="{}"> </span></p> <hr> <h3><strong>Key Responsibilities:<br></strong><span style="font-size: 14px;"><br>DevOps & CI/CD</span></h3> <ul> <li data-leveltext="" data-font="Symbol" data-listid="3" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1"><span data-contrast="auto">Assesses and centralizes CI/CD and deployment practices across product lines; owns the rollout</span></li> <li data-leveltext="" data-font="Symbol" data-listid="3" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Directly contributes where useful — e.g., containerizing and automating deployments, not just directing others</li> <li data-leveltext="" data-font="Symbol" data-listid="3" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Improves deployment frequency, predictability, environment consistency, and release safety<span data-ccp-props="{}"> </span></li> </ul> <p><strong>Site Reliability Engineering & Observability</strong></p> <ul> <li data-leveltext="" data-font="Symbol" data-listid="11" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1"><span data-contrast="auto">Stands up SLOs/SLIs, error budgets, and production reliability standards</span></li> <li data-leveltext="" data-font="Symbol" data-listid="11" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Owns monitoring, alerting, and observability patterns/dashboards, standardized across teams</li> <li data-leveltext="" data-font="Symbol" data-listid="11" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Partners with development teams on consistent instrumentation rather than owning their code<span data-ccp-props="{}"> </span></li> </ul> <p><strong>Incident Management & Operational Discipline</strong></p> <ul> <li data-leveltext="" data-font="Symbol" data-listid="6" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1"><span data-contrast="auto">Owns on-call tooling, rotation design, and escalation policy company-wide, partnering with Support, Product, QA, and Development to ensure comprehensive escalation resolutions</span></li> <li data-leveltext="" data-font="Symbol" data-listid="6" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Defines and enforces RCA and post-incident review discipline, using AI to speed investigation and information-gathering</li> <li data-leveltext="" data-font="Symbol" data-listid="6" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Builds these as adopted practices across teams that don't report to this role — requires real influence without authority<span data-ccp-props="{}"> </span></li> </ul> <p><strong>Database Reliability Engineering (DBRE)</strong></p> <ul> <li data-leveltext="" data-font="Symbol" data-listid="9" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1"><span data-contrast="auto">Owns operational reliability of First Due's core production database(s): uptime, query performance, capacity</span></li> <li data-leveltext="" data-font="Symbol" data-listid="9" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Defines schema-change practice and review discipline for a monolithic, high-traffic database</li> <li data-leveltext="" data-font="Symbol" data-listid="9" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Partners with Infrastructure on backup, continuity, and BCDR runbooks, and is accountable for testing them<span data-ccp-props="{}"> </span></li> </ul> <p><strong>Engineering Operations & Metrics</strong></p> <ul> <li data-leveltext="" data-font="Symbol" data-listid="2" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1"><span data-contrast="auto">Defines and implements the operational metrics set (deployment frequency, MTTR, system health, uptime), distinct from delivery/velocity metrics</span></li> <li data-leveltext="" data-font="Symbol" data-listid="2" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Builds the dashboards and reporting giving engineering and executive leadership real visibility into system health <span data-ccp-props="{}"> </span></li> <li data-leveltext="" data-font="Symbol" data-listid="2" data-list-defn-props="{" data-aria-posinset="1" data-aria-level="1">Formalizes the AI natural-language query layer already in use against observability data into a shared standard for "how we observe system health"<span data-ccp-props="{}"> </span></li> </ul> <p><strong>Developer Experi