09 Aug
|
Socket.dev
|
Calgary
09 Aug
Socket.dev
Calgary
Role: System & Network Administrator
Location: Calgary, AB
Duration: long Term Contract
Job Description:
The System & Network Administrator will be responsible for administration, support, optimization, and continuous improvement of enterprise monitoring and observability platforms including SolarWinds Orion, Splunk, and Dynatrace. The role focuses on monitoring infrastructure, applications, cloud environments, and enterprise services while integrating monitoring solutions with ServiceNow for incident and event management.
Essential Skills & Experience
Required Experience
8+ years of experience in Infrastructure Operations, Monitoring Services, Enterprise Monitoring, or Observability platforms.
5+ years of hands-on experience administering enterprise monitoring tools.
Strong troubleshooting, analytical, and stakeholder management skills.
Experience supporting production infrastructure, cloud services, applications, networks, storage, and enterprise platforms.
Hands-on experience with automation using PowerShell, Python, REST APIs, and operational workflows.
SolarWinds Expertise
- Solid expertise with SolarWinds Orion, including:
- Network Performance Monitor (NPM)
- Server & Application Monitor (SAM)
- Alerting
- Custom Polling
- Dashboards
- Reporting
- Infrastructure Monitoring
- Network Monitoring
Splunk Expertise
- Strong expertise with Splunk, including:
- SPL Queries
- Data Onboarding
- Dashboards
- Reports
- Alerts
- Log Analytics
- Event Correlation
Dynatrace Expertise
- Strong experience with Dynatrace, including:
- OneAgent
- Smartscape
- Distributed Tracing
- Synthetic Monitoring
- Real User Monitoring (RUM)
- Service Flow Analysis
ServiceNow Integration
Experience integrating monitoring platforms with ServiceNow Incident Management, Event Management, and ITOM capabilities.
Experience supporting automated incident generation and operational response workflows.
Key Responsibilities
Monitoring Platform Administration
Administer, support, and optimize SolarWinds Orion, Splunk, and Dynatrace platforms.
Ensure platform availability, scalability, performance, and operational health.
Perform upgrades, maintenance, configuration reviews, and platform optimization activities.
Monitoring & Observability Engineering
Design and maintain monitoring solutions for:
- Infrastructure
- Network
- Cloud
- Storage
- Backup
- Applications
- Enterprise Services
Implement proactive monitoring and observability capabilities across enterprise environments.
Enhance monitoring coverage and improve operational visibility.
Alerting, Dashboards & Event Correlation
Build dashboards, alerts, reports, service health views, and event correlation rules.
Drive alert quality improvements and reduce alert noise across monitoring platforms.
Establish monitoring standards and operational dashboards for business and technical stakeholders.
ServiceNow Integration
Integrate monitoring platforms with ServiceNow Incident Management and Event Management workflows.
Support automated incident generation and operational response workflows.
Improve operational visibility through integrated monitoring and ITSM processes.
Incident Management & RCA Support
Support Major Incident investigations and monitoring-related root cause analysis activities.
Identify monitoring gaps and implement remediation plans.
Contribute to service reliability and operational resilience initiatives.
Automation & Continuous Improvement
Develop automation solutions using scripting and APIs to improve operational efficiency.
Drive AIOps, observability, and event management maturity initiatives.
Continuously evaluate monitoring effectiveness and recommend improvements.
#J-18808-Ljbffr
📌 Network & System Administrator (Calgary)
🏢 Socket.dev
📍 Calgary