Not finding it? Sign in to also search OpenAlex live.
-
DiBiMT : A Gold Evaluation Benchmark for Studying Lexical Ambiguity in Machine Translation2024 Computational Linguistics article Computer Science Natural Language Processing Techniques Open access
Federico Martelli, Stefano Parrella, Niccolò Campolungo, Tina Munda, Svetla Koeva, Carole Tiberius, +1 more
2citations -
Autonomous medical evaluation for guideline adherence of large language models2024 npj Digital Medicine article Medicine Artificial Intelligence in Healthcare and Education Open access cited by 1 patent
Dennis Fast, Lisa C. Adams, Felix Busch, Conor Fallon, Marc Huppertz, Robert Malte Siepmann, +6 more
38citations -
A benchmark for neural network robustness in skin cancer classification2021 European Journal of Cancer article Medicine Cutaneous Melanoma Detection and Management Open access
Roman Christoph Maron, Justin Gabriel Schlager, Sarah Haggenmüller, Christof V. Kalle, Jochen Sven Utikal, Friedegund Elke Meier, +22 more
65citations -
WorkRB: A Community-Driven Evaluation Framework for AI in the Work Domain2026 ACM Conference on Recommender Systems (RecSys) conference-paper Business, Management and Accounting AI and HR Technologies Open access
Matthias De Lange, Warre Veys, Federico Retyk, Daniel Deniz, Warren Jouanneau, Mike Zhang, +13 more
0citations -
Evaluating large language models on business process modeling: framework, benchmark, and self-improvement analysis2025 Software & Systems Modeling article Business, Management and Accounting Business Process Modeling and Analysis Open access
Humam Kourani, Alessandro Berti, Daniel Schuster, Wil M. P. van der Aalst
32citations -
BURST: A Benchmark for Unifying Object Recognition, Segmentation and Tracking in Video2022 RWTH Publications (RWTH Aachen) conference-paper Computer Science Video Surveillance and Tracking Methods Open access
Ali Athar, Jonathon Luiten, Paul Voigtlaender, Tarasha Khurana, Achal Dave, Bastian Leibe, +1 more
2citations -
Evaluating Large Language Models on Business Process Modeling: Framework, Benchmark, and Self-Improvement Analysis2024 arXiv (Cornell University) preprint Business, Management and Accounting Business Process Modeling and Analysis Open access
Humam Kourani, Alessandro Berti, Daniel Schuster, Wil M. P. van der Aalst
0citations -
BURST: A Benchmark for Unifying Object Recognition, Segmentation and Tracking in Video2023 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) conference-paper Computer Science Video Surveillance and Tracking Methods
Ali Athar, Jonathon Luiten, Paul Voigtlaender, Tarasha Khurana, Achal Dave, Bastian Leibe, +1 more
51citations -
Validating Orthopaedic Data Evaluation Panel (ODEP) Ratings Across 9 Orthopaedic Registries2024 Journal of Bone and Joint Surgery article Medicine Orthopaedic implants and arthroplasty Open access
Lotje Anna Hoogervorst, Maartje M. van Tilburg, Anne Lübbeke, T. J. Wilton, Rob G. H. H. Nelissen, Perla J. Marang‐van de Mheen
7citations -
Analytical choices drive toxicogenomic potency estimates: a systematic evaluation of transcriptomic points of departure2026 Toxicological Sciences article Biochemistry, Genetics and Molecular Biology Carcinogens and Genotoxicity Assessment Open access
Imke B. Bruns, Dayna R. Schultz, Emmanuel Demuynck, Friedel Dewulf, Ioannis Theologidis, Steven J. Kunnen, +12 more
0citations