Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Duration 21 hours
Course Outline
Foundations of Audio Classification
- Categorization of sound events: environmental, mechanical, and human-generated.
- Overview of key use cases including surveillance, monitoring, and automation.
- Distinguishing between audio classification, detection, and segmentation.
Audio Data and Feature Extraction
- Understanding various audio file types and formats.
- Considerations for sampling rates, windowing, and frame sizes.
- Techniques for extracting MFCCs, chroma features, and mel-spectrograms.
Data Preparation and Annotation
- Utilizing datasets such as UrbanSound8K, ESC-50, and custom collections.
- Labeling sound events and defining temporal boundaries.
- Strategies for balancing datasets and applying audio augmentation.
Building Audio Classification Models
- Application of convolutional neural networks (CNNs) for audio tasks.
- Evaluating model inputs: raw waveforms versus extracted features.
- Managing loss functions, evaluation metrics, and preventing overfitting.
Event Detection and Temporal Localization
- Implementing frame-based and segment-based detection strategies.
- Post-processing detections using thresholds and smoothing techniques.
- Visualizing predictions along audio timelines.
Advanced Topics and Real-Time Processing
- Applying transfer learning to address low-data scenarios.
- Model deployment using TensorFlow Lite or ONNX.
- Managing streaming audio processing and latency considerations.
Project Development and Application Scenarios
- Designing a comprehensive pipeline from data ingestion to classification.
- Creating proof-of-concept solutions for surveillance, quality control, or monitoring.
- Integrating logging, alerting, and dashboards or APIs.
Summary and Next Steps
Requirements
- Proficiency in machine learning concepts and the model training lifecycle.
- Hands-on experience with Python programming and data preprocessing workflows.
- Knowledge of digital audio fundamentals.
Target Audience
- Data scientists.
- Machine learning engineers.
- Researchers and developers specializing in audio signal processing.