← all repositories

THUDM/AlignBench

A comprehensive multi-dimensional benchmark for evaluating Chinese large language model alignment using LLM-as-Judge methodology.

431 stars Python LLMOps · Eval
AlignBench
Not currently ranked — collecting fresh signals.
star history

AlignBench is a benchmark designed to evaluate the alignment performance of Chinese large language models. It employs a multi-dimensional, rule-calibrated LLM-as-Judge evaluation approach combined with Chain-of-Thought reasoning to generate analysis and final scores. The benchmark includes a human-involved data construction pipeline to ensure dynamic updates of evaluation data and covers multiple evaluation dimensions to assess real-world model performance.

Frequently asked

What is THUDM/AlignBench?
A comprehensive multi-dimensional benchmark for evaluating Chinese large language model alignment using LLM-as-Judge methodology.
Is AlignBench open source?
Yes — THUDM/AlignBench is an open-source project tracked on heatdrop.
What language is AlignBench written in?
THUDM/AlignBench is primarily written in Python.
How popular is AlignBench?
THUDM/AlignBench has 431 stars on GitHub.
Where can I find AlignBench?
THUDM/AlignBench is on GitHub at https://github.com/THUDM/AlignBench.

heatdrop uses Google Analytics to see which pages get read — nothing else. Your call. How we handle data.