About

Portrait of Xingchen Song

Xingchen Song 宋星辰

I work on speech recognition, speech synthesis, and audio language models, with a focus on efficient training and inference. I develop open-source tools for multimodal model training, speech tokenization, and speech generation.

Research Interests

  • Streaming and end-to-end speech recognition
  • Speech synthesis and audio language models
  • Efficient multimodal training and inference

Selected Publications

For the complete list, please visit my Google Scholar profile.

2026

2025

  • MiMo-Audio: Audio Language Models are Few-Shot Learners

    Xiaomi LLM-Core Team (including Xingchen Song)

    Full author listXiaomi LLM-Core Team, Dong Zhang, Gang Wang, Jinlong Xue, Kai Fang, Liang Zhao, Rui Ma, Shuhuai Ren, Shuo Liu, Tao Guo, Weiji Zhuang, Xin Zhang, Xingchen Song, Yihan Yan, Yongzhe He, Cici, Bowen Shen, Chengxuan Zhu, Chong Ma, Chun Chen, Heyu Chen, Jiawei Li, Lei Li, Menghang Zhu, Peidian Li, Qiying Wang, Sirui Deng, Weimin Xiong, Wenshan Huang, Wenyu Yang, Yilin Jiang, Yixin Yang, Yuanyuan Tian, Yue Ma, Yue Yu, Zihan Zhang, Zihao Yue, Bangjun Xiao, Bingquan Xia, Bofei Gao, Bowen Ye, Can Cai, Chang Liu, Chenhong He, Chunan Li, Dawei Zhu, Duo Zhang, Fengyuan Shi, Guoan Wang, Hailin Zhang, Hanglong Lv, Hanyu Li, Hao Tian, Heng Qu, Hongshen Xu, Houbin Zhang, Huaqiu Liu, Jiangshan Duo, Jianguang Zuo, Jianyu Wei, Jiebao Xiao, Jinhao Dong, Jun Shi, Junhao Hu, Kainan Bao, Kang Zhou, Linghao Zhang, Meng Chen, Nuo Chen, Peng Zhang, Qianli Chen, Qiantong Wang, Rang Li, Shaohui Liu, Shengfan Wang, Shicheng Li, Shihua Yu, Shijie Cao, Shimao Chen, Shuhao Gu, Weikun Wang, Wenhan Ma, Xiangwei Deng, Xing Yong, Xing Zhang, Xu Wang, Yifan Song, Yihao Zhao, Yingbo Zhao, Yizhao Gao, Yu Cheng, Yu Tu, Yudong Wang, Zhaojun Huang, Zhengju Tang, Zhenru Lin, Zhichao Song, Zhipeng Xu, Zhixian Zheng, Zihan Jiang

    Technical report · 2025 Paper arXiv PDF

  • Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding

    Haoran Zhou, Xingchen Song, Brendan Fahy, Qiaochu Song, Binbin Zhang, Zhendong Peng, Anshul Wadhawan, Denglin Jiang, Apurv Verma, Vinay Ramesh, Srivas Prasad, Michele M. Franceschini

    Interspeech · 2025 Paper arXiv PDF

2024

2023

2022

2021

2020

Open-Source Projects

  • TouchNet

    Personal project · In development

    A native PyTorch library for large-scale text and audio language model training, with multimodal data pipelines, sequence packing, distributed checkpointing, and N-dimensional parallelism.

  • FlashCosyVoice

    Personal project

    A lightweight inference engine for CosyVoice, built for distributed offline speech generation. It supports prefix caching, torch compilation, and CUDA graphs in a compact Python implementation.

  • S3Tokenizer

    Personal project

    A PyTorch implementation of the supervised semantic speech tokenizer used in CosyVoice, supporting batch and distributed inference, online speech token extraction, and long audio processing.

  • WeNet

    Contributor

    A production-oriented toolkit for streaming and non-streaming end-to-end speech recognition. My related publications include WeNet 2.0, TrimTail, ZeroPrompt, and U2++ MoE.

  • QwenAudio Toolkits

    Contributor

    A desktop workspace for audio AI models, covering speech recognition, audio enhancement, text normalization, and speech synthesis, with local model runtimes and optional cloud models.

More projects on GitHub

Education

Experience

  • Research Intern @ Microsoft Research Asia (MSRA)

    Speech Group · Dec. 2020–Mar. 2021

    Mispronunciation detection and diagnosis.

    Mentors: Frank K. Soong

  • Research Intern @ Tencent AI Lab

    Speech Group · Jun. 2019–Dec. 2020

    Acoustic modeling and end-to-end speech recognition.

    Mentors: Guangsen Wang, Yiheng Huang