
معرفی
Florian Metze is an Adjunct Professor at the Language Technologies Institute (LTI) within the School of Computer Science at Carnegie Mellon University. His work focuses on advanced speech and audio processing, multimodal learning, and machine learning applications in under-resourced languages. He leads research in speech recognition, generative audio models, and cross-modal understanding.
His research interests emphasize leveraging audiovisual data for robust speech recognition, developing scalable solutions for low-resource languages, and advancing multimodal systems through innovations like diffusion-based text-to-audio generation (Audio-Journey) and modular neural architectures (Legonn). His contributions include foundational work on wake-word detection, speaker verification (MASV), and context-aware error correction in ASR systems.
Collaborative projects span speech technology for unwritten languages, child phonetic acquisition modeling, and integrating visual context into speech processing pipelines. His work often bridges theoretical advancements with practical applications in edge computing, security, and biomedical signal analysis (e.g., heart sound monitoring).
Metze's research outputs include over 100 peer-reviewed articles since 2018, with recent emphasis on large language models for multitalker scenarios, efficient neural architectures, and cross-modal representation learning. He actively contributes to open-source tools like the ACLEW DiViMe diarization toolkit.



