Senior SoC Architect, RAS
NVIDIAJob Title
Senior SoC Architect, RAS
Role Summary
Senior hardware architect responsible for defining and driving Reliability, Availability, and Serviceability (RAS) hardware architecture across Tegra SoCs and CPUs. The role spans architecture specification through implementation, verification, validation, and production readiness.
Work cross-functionally with systems architects, design, verification, validation, firmware, and software teams to deliver RAS features that improve resiliency, observability, debugability, recovery, and serviceability for datacenter, automotive, edge, and high-reliability environments.
Experience Level
Senior β requires substantial experience. The posting requests at least 8+ years of SoC architecture, design, verification, reliability, silicon validation, or related hardware development experience.
Responsibilities
Primary responsibilities include end-to-end RAS architecture definition and cross-functional delivery.
- Define and drive SoC-level RAS hardware architecture across CPUs, interconnects, memory, IO, safety islands, firmware interfaces, and platform components.
- Own RAS features from concept through architecture spec, micro-architecture alignment, RTL implementation support, verification, silicon validation, debug, and production readiness.
- Develop architectural requirements for fault detection, correction, containment, telemetry, error reporting, recovery, degradation modes, and diagnostics.
- Collaborate with design, verification, validation, firmware, software, and platform teams to ensure features are implementable and verifiable.
- Analyze interactions between RAS mechanisms and performance, power, resets, clocks, memory hierarchy, interconnects, and platform software.
- Create hardware specifications, error-handling flows, test plans, and architectural models (SystemC, C/C++, Python, etc.).
- Plan and review verification and validation strategies, including error injection, recovery validation, coverage analysis, and resiliency modeling.
- Assist failure analysis and silicon debug; develop diagnostics for latent, intermittent, and environment-sensitive failures.
- Apply RAS principles to high-reliability and radiation-aware use cases; follow industry standards for RAS, functional safety, and semiconductor reliability.
- Patent novel hardware architecture techniques that improve resiliency, observability, and serviceability.
Requirements
Must-have technical skills, domain experience, and cross-functional abilities.
- 8+ years of relevant SoC architecture, design, verification, reliability, silicon validation, or related hardware development experience.
- Strong understanding of SoC RAS: fault detection, correction, containment, telemetry, recovery, graceful degradation, and debug visibility.
- Proven track record driving hardware architecture through definition, implementation, verification, validation, and production readiness.
- Deep knowledge of SoC architecture, micro-architecture, full-chip integration, firmware interfaces, and software-visible behavior.
- Experience with design verification, silicon validation, fault injection, coverage analysis, resiliency modeling, or diagnostic development.
- Domain expertise in areas such as safety, debug, clocks/resets, interconnects, memory controllers, IO, platform integration, or diagnostic infrastructure.
- Familiarity with radiation effects and high-reliability deployment considerations preferred.
- Strong analytical, written, and verbal communication skills for cross-functional collaboration.
Education Requirements
MS or PhD in computer engineering, electrical engineering, or a related field, or equivalent practical experience.
About the Company
Company: NVIDIA
Headquarters: Santa Clara, California, USA
NVIDIA is a global leader in accelerated computing, renowned for its innovative solutions in AI and digital twins that transform diverse industries. The company specializes in networking technologies, providing end-to-end InfiniBand and Ethernet solutions for servers and storage that optimize performance and scalability. NVIDIA serves sectors such as high-performance computing, enterprise data centers, and cloud computing, constantly reinventing its products and services to stay ahead in the market.
