Input and output
Accepts Text, Audio, Image, Video inputs. Returns Text outputs.
MiMo-V2.5 is a native omnimodal model by Xiaomi. It delivers Pro-level agentic performance at roughly half the inference cost, while surpassing MiMo-V2-Omni in multimodal perception across image and video understanding...
Accepts Text, Audio, Image, Video inputs. Returns Text outputs.