Developing AI systems that bridge visual perception with natural language understanding.
Areas of Focus
- Vision Transformers (ViT) and CLIP architectures
- Visual question answering systems
- Image captioning and scene description
- Diffusion models for generative AI
- Cross-modal learning and reasoning
Recent Work
2nd Place at ACM Hackathon for VLM-based generative AI application (Apr 2025)