Conceptio
›
benchmark
Topic
benchmark
Knowledge-graph topic
· documents ABOUT benchmark across the archive
38
Documents about benchmark
Documents about benchmark
gaia-benchmark/GAIA
#786526
Hugging Face Datasets
ScaleAI/SWE-bench_Pro
#786861
Hugging Face Datasets
SWE-bench/SWE-bench_Verified
#786954
Hugging Face Datasets
BLM-Hum1800: A Human-Validated Benchmark for Linguistic Competence in English and French
#486095
PsyArXiv
BLM-Hum1800: A Human-Validated Benchmark for Linguistic Competence in English and French
#477869
OSF
Benchmark Epistemology
#714611
PhilArchive
OmarElalaily/Feature-Extraction-Benchmark-SIFT-ORB-ResNet50: Feature-Extraction-Benchmark-SIFT-ORB-ResNet50
#195192
Zenodo
IH-Benchmark: A Conflict-Centered Benchmark for Instruction-Hierarchy Robustness in LLM Applications
#410957
arXiv CS
allenai/olmOCR-bench
#786681
Hugging Face Datasets
SQL-RewriteBench: A Correctness-Gated, Full-Denominator Benchmark for Statement-Level SQL Rewriting [Experiment,Analysis & Benchmark]
#618665
arXiv (OAI Expanded)
SQL-RewriteBench: A Correctness-Gated, Full-Denominator Benchmark for Statement-Level SQL Rewriting [Experiment,Analysis & Benchmark]
#620344
arXiv (All)
Dyadic Human-State Mediation Benchmark Charter v0.1: Benchmark Charter for AI Output → Human-State Delta → Dyadic Recovery
#704506
PhilArchive
GeoMod2008 materials benchmark: The sieve dataset
#272912
DOIDB Metadata Store
GeoMod2008 materials benchmark: The axial test dataset
#272910
DOIDB Metadata Store
GeoMod2008 materials benchmark: The SEM image dataset
#272913
DOIDB Metadata Store
SQL-RewriteBench: A Correctness-Gated, Full-Denominator Benchmark for Statement-Level SQL Rewriting [Experiment,Analysis & Benchmark]
#361536
arXiv CS
Radio Meteor Zoo benchmark and reproducibility package
#677887
KU Leuven RDR Dataverse OAI Archive
Towards a Reliable Intrusion Detection Benchmark Dataset
#199611
OpenAlex
GeoMod2008 materials benchmark: The ring shear test dataset
#272911
DOIDB Metadata Store
The Multimodal Brain Tumor Image Segmentation Benchmark (BRATS)
#7411
OpenAlex
agents-last-exam/agents-last-exam
#786784
Hugging Face Datasets
cais/hle
#786515
Hugging Face Datasets
The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning
#199362
OpenAlex
TurkishLegalBench: A Comprehensive Multi-Task Benchmark Suite for Turkish Legal NLP
#264363
Zenodo (CERN)
Bayesian Networks for Benchmark Validity in Score Reporting: An ePIRLS Demonstration
#267133
OSF
ThreatCore: A Benchmark for Explicit and Implicit Threat Detection
#652977
IRIS
The Human Creativity Benchmark
#321866
arXiv CS
Ultrasound Benchmark Dataset for Automatic Segmentation of Endometriotic Lesions
#456749
Figshare
TIGER-Lab/MMLU-Pro
#786564
Hugging Face Datasets
DGGS Benchmark Replication Study - Results Dataset
#187155
Zenodo (CERN)
RUMBA: Russian User Memory Benchmark
#394452
arXiv CS
LexGLUE: A Benchmark Dataset for Legal Language Understanding in English
#335664
OpenAlex
AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models
#203220
OpenAlex
MUVOD: A Novel Multi-View Video Object Segmentation Dataset and a Benchmark for 3D Segmentation
#215407
HAL (France)
mercor/apex-agents
#786870
Hugging Face Datasets
LLM Benchmark Datasets Should Be Contamination-Resistant
#204706
arXiv CS
CogScale: Scalable Benchmark for Sequence Processing
#204866
arXiv CS
Benchmark Everything Everywhere All at Once
#259506
arXiv CS
STEB: Style Text Embedding Benchmark
#324902
arXiv CS
ContextWeave: A Real-World Workflow Benchmark
#429407
arXiv CS
Data for Upscaling mineralogy with hyperspectral data: a benchmark dataset and machine learning framework to enable hyperspectral geometallurgy
#251887
RODARE
Viability Assessment of Bovine Embryos: A Public Dataset and Deep Learning Baselines
#291207
DigitalCommons@USU
MD-0002: Frozen Materials Project benchmark slice of stable ternary oxides
#346347
Zenodo (CERN)
openai/gsm8k
#786496
Hugging Face Datasets
Idavidrein/gpqa
#786559
Hugging Face Datasets
MMAE: A Massive Multitask Audio Editing Benchmark
#269393
Papers With Code
AgenticDataBench: A Comprehensive Benchmark for Data Agents
#332621
arXiv CS
How to benchmark medical AI agents.
#358205
NCBI PubMed Central
Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense
#414061
arXiv CS
A Unified Benchmark for Privacy-preserving Vector Search
#423861
arXiv CS
Topic record
· derived from the Conceptio knowledge graph (shared subject terms across the corpus)
Conceptio Open Knowledge Archive — topic hubs link to canonical document pages with full provenance.