Publications
Yuma Narahata, Tomohiko Nakamura, Yuki Saito, and Hiroshi Saruwatari, "Lead vocal separation from vocal ensemble mixtures using phoneme alignment," in Proceedings of Asia Pacific Signal and Information Processing Association Annual Summit and Conference, Nov. 2026.
Kengo Takemoto, Tomohiko Nakamura, and Hiroshi Saruwatari, "Differentiable digital signal processing mixture model-based diffusion for synthesis parameter estimation from harmonic sound mixtures," in Proceedings of Asia Pacific Signal and Information Processing Association Annual Summit and Conference, Nov. 2026.
Nobutaka Ito and Yoshiaki Bando, "Subspace track-before-detect for passive multi-target tracking in the presence of unknown emitted signals," in Proceedings of Asia Pacific Signal and Information Processing Association Annual Summit and Conference, Nov. 2026.
Hirotaka Nishikori, Nobutaka Ito, Kouei Yamaoka, Norihiro Takamune, and Hiroshi Saruwatari, "Fast multichannel NMF with block-diagonal spatial covariance matrices for efficient blind source separation using distributed microphone arrays," in Proceedings of Asia Pacific Signal and Information Processing Association Annual Summit and Conference, Nov. 2026.
William Chen, Shinnosuke Takamichi, Sayaka Shiota, Satoru Fukayama, Samuele Cornell, and Shinji Watanabe, "YODAS v3: Over 1 Million Hours of High-Bandwidth, Stereophonic, Multilingual Speech," in Proceedings of INTERSPEECH, Sept. 2026.
Kentaro Onda, Satoru Fukayama, Daisuke Saito, and Nobuaki Minematsu, "Leveraging Soft Distributions of SSL-Derived Discrete Speech Tokens for Downstream Inference," in Proceedings of INTERSPEECH, Sept. 2026.
Sota Koshino, Shotaro Ueji, Shinnosuke Takamichi, and Tomohiko Nakamura, "Automatic generation of audio comic from manga images," in Proceedings of INTERSPEECH, Show&Tell Session, Sept. 2026.
Woan-Shiuan Chien, Tomohiko Nakamura, Huan-Yu Chen, Fukayama Satoru, Hitoshi Suda, Jun Ogata, and Chi-Chun Lee, "Two-sided fairness transfer for gender-neutral speech emotion recognition with partially observed attributes," in Proceedings of INTERSPEECH, Sept. 2026.
Daigo Takizawa, Tomohiko Nakamura, Samuele Cornell, William Chen, Satoru Fukayama, and Shinji Watanabe, "Dissecting sensitivity to training language in self-supervised speech learning using neural audio codec tokens," in Proceedings of INTERSPEECH, Sept. 2026.
Nobutaka Ito, "A unified complex spherical Student's t mixture model for directional statistics in mask-based blind speech separation," in Proceedings of International Workshop on Acoustic Signal Enhancement, Sept. 2026.

