Yuta Oshima

I’m a Ph.D. student at The University of Tokyo, mentored by Professor Yutaka Matsuo.

I conduct research on generative models, image and video generation, and world models. My work aims to develop scalable, general-purpose generative models to create and simulate the visual world.

selected publications

  1. CVPR 2026 Main
    multibanana_teaser.png
    MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
    Yuta Oshima, Daiki Miyake, Kohsei Matsutani, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, and Hiroki Furuta
    In the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
  2. TMLR 2026
    worldpack.png
    WorldPack: Dynamic Frame Compression for Long-context Video World Modeling
    Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, and Hiroki Furuta
    In Transactions on Machine Learning Research, 2026
  3. NeurIPS 2025
    dlbs_teaser.gif
    Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search
    Yuta Oshima, Masahiro Suzuki, Yutaka Matsuo, and Hiroki Furuta
    In Neural Information Processing Systems (NeurIPS), 2025