Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Course Outline
Core Principles of Agentic Systems in Production
- Architectural components: loops, tools, memory structures, and orchestration layers
- The complete agent lifecycle: from development and deployment to continuous operation
- Key challenges in managing agents at production scale
Infrastructure Architectures and Deployment Models
- Deploying agents within containerized and cloud-native environments
- Scaling strategies: horizontal versus vertical scaling, concurrency management, and throttling
- Orchestrating multi-agent systems and balancing distributed workloads
Monitoring and Observability Frameworks
- Critical metrics: latency, success rates, memory consumption, and agent call depth
- Tracing agent activities and visualizing call graphs
- Implementing observability instruments using Prometheus, OpenTelemetry, and Grafana
Logging, Auditing, and Regulatory Compliance
- Centralized logging strategies and structured event collection
- Ensuring compliance and auditability within agentic workflows
- Designing robust audit trails and replay mechanisms to facilitate debugging
Performance Optimization and Resource Management
- Minimizing inference overhead and refining agent orchestration cycles
- Leveraging model caching and lightweight embeddings to accelerate retrieval processes
- Conducting load testing and simulating stress scenarios for AI pipelines
Cost Governance and Financial Control
- Analyzing primary cost drivers: API calls, memory usage, compute resources, and external integrations
- Tracking agent-level expenditures and implementing chargeback models
- Establishing automation policies to curb agent sprawl and eliminate idle resource consumption
CI/CD Integration and Rollout Strategies
- Embedding agent pipelines into existing CI/CD systems
- Implementing testing, versioning, and rollback protocols for iterative agent updates
- Executing progressive rollouts and safe deployment mechanisms
Failure Recovery and Reliability Engineering
- Architecting for fault tolerance and ensuring graceful degradation
- Applying retry, timeout, and circuit breaker patterns to enhance agent reliability
- Establishing incident response and post-mortem frameworks for AI operations
Capstone Project
- Construct and deploy an agentic AI system featuring comprehensive monitoring and cost tracking
- Simulate load conditions, measure performance metrics, and optimize resource utilization
- Present the final architecture and monitoring dashboard to peers
Summary and Future Directions
Requirements
- Comprehensive knowledge of MLOps principles and production-grade machine learning systems
- Practical experience with containerized deployment technologies (Docker/Kubernetes)
- Working familiarity with cloud cost optimization strategies and observability tooling
Target Audience
- MLOps Engineers
- Site Reliability Engineers (SREs)
- Engineering Managers responsible for AI infrastructure oversight
21 Hours
Testimonials (3)
The trainer is patient and very helpful. He knows the topic well.
CLIFFORD TABARES - Universal Leaf Philippines, Inc.
Course - Agentic AI for Business Automation: Use Cases & Integration
Good mixvof knowledge and practice
Ion Mironescu - Facultatea S.A.I.A.P.M.
Course - Agentic AI for Enterprise Applications
The mix of theory and practice and of high level and low level perspectives