MMMG: A Comprehensive and Reliable Benchmark for Multitask Multimodal Generation
Evaluation suite for diverse multitask multimodal generation with large multimodal models.
•
1 min read
Read more
Evaluation suite for diverse multitask multimodal generation with large multimodal models.
Benchmarking dark pattern susceptibility of computer-use agents in realistic UI environments.
Learning metrics for evaluating recommendation explanations.