Project Overview
Deep learning-based medical image classification project exploring custom CNN architectures and Vision Transformer (ViT).
Problem Definition & Goals
- Problem: Medical image classification faces unique challenges like limited labeled data and class imbalance.
- Goal 1: Compare CNN and ViT architectures for medical image classification.
- Goal 2: Develop effective data augmentation strategies for limited labeled medical data.
- Goal 3: Address class imbalance problems common in medical datasets.
Key Features & Contributions
- CNN Architecture: Designed and implemented custom Convolutional Neural Network optimized for medical images.
- ViT Exploration: Applied Vision Transformer architecture and compared performance with CNN.
- Data Augmentation: Implemented augmentation techniques suitable for medical images.
- Imbalance Handling: Applied weighted loss functions and oversampling techniques.
Technical Challenges & Solutions
- Data Scarcity: Limited labeled medical images. Supplemented with data augmentation and transfer learning.
- Class Imbalance: Some disease classes were rare. Solved with weighted loss and oversampling techniques.
- Model Interpretability: Medical diagnosis needs explanation. Analyzed attention regions with GradCAM visualization.
- Generalization: Performance drops on different domains. Applied diverse data sources and regularization techniques.
Results & Learnings
- Classification Performance: Both CNN and ViT achieved high accuracy, ViT performing better in some cases.
- Data Efficiency: Augmentation techniques significantly improved model performance on limited data.
- Interpretable Results: GradCAM visualization confirmed model focuses on correct regions.
- Key Learning: Gained expertise in medical image analysis, data imbalance handling, and model interpretability.