如何定义摘要评估器

有些指标只能在整个实验级别定义，而不能在实验的单个运行中定义。例如，您可能希望计算评估目标在数据集中所有示例上的总体通过率或 F1 分数。这些被称为摘要评估器。

基本示例

在这里，我们将计算 F1 分数，它是精确度和召回率的组合。这种指标只能在实验中的所有示例上计算，因此我们的评估器接收一个输出列表和一个 reference_outputs 列表。

def f1_score_summary_evaluator(outputs: list[dict], reference_outputs: list[dict]) -> dict:
    true_positives = 0
    false_positives = 0
    false_negatives = 0

    for output_dict, reference_output_dict in zip(outputs, reference_outputs):
        output = output_dict["class"]
        reference_output = reference_output_dict["class"]

        if output == "Toxic" and reference_output == "Toxic":
            true_positives += 1
        elif output == "Toxic" and reference_output == "Not toxic":
            false_positives += 1
        elif output == "Not toxic" and reference_output == "Toxic":
            false_negatives += 1

    if true_positives == 0:
        return {"key": "f1_score", "score": 0.0}

    precision = true_positives / (true_positives + false_positives)
    recall = true_positives / (true_positives + false_negatives)
    f1_score = 2 * (precision * recall) / (precision + recall)

    return {"key": "f1_score", "score": f1_score}

然后，您可以将此评估器传递给 evaluate 方法，如下所示

from langsmith import Client

ls_client = Client()
dataset = ls_client.clone_public_dataset(
    "https://smith.langchain.com/public/3d6831e6-1680-4c88-94df-618c8e01fc55/d"
)

def bad_classifier(inputs: dict) -> dict:
    return {"class": "Not toxic"}

def correct(outputs: dict, reference_outputs: dict) -> bool:
    """Row-level correctness evaluator."""
    return outputs["class"] == reference_outputs["label"]

results = ls_client.evaluate(
    bad_classified,
    data=dataset,
    evaluators=[correct],
    summary_evaluators=[pass_50],
)

在 LangSmith 用户界面中，您将看到摘要评估器的分数以及相应的键。

摘要评估器参数

摘要评估器函数必须具有特定的参数名称。它们可以包含以下参数的任意子集

inputs: list[dict]：与数据集中单个示例对应的输入列表。
outputs: list[dict]：每个实验在给定输入上产生的字典输出列表。
reference_outputs/referenceOutputs: list[dict]：与示例关联的参考输出列表（如果可用）。
runs: list[Run]：两个实验在给定示例上生成的完整 Run 对象列表。如果您需要访问中间步骤或每个运行的元数据，请使用此项。
examples: list[Example]：所有数据集 Example 对象，包括示例输入、输出（如果可用）和元数据（如果可用）。

摘要评估器输出

摘要评估器应返回以下类型之一： Python 和 JS/TS

dict：形式为 {"score": ..., "name": ...} 的字典允许您传递数字或布尔分数和指标名称。

目前仅限 Python

int | float | bool：这被解释为一个连续指标，可以进行平均、排序等。函数名称用作指标的名称。

在 GitHub 上编辑此页面源文件。

以编程方式连接这些文档到 Claude、VSCode 等，通过 MCP 获取实时答案。

数据集

设置评估

分析实验结果

标注与人工反馈

常见数据类型

基本示例

摘要评估器参数

摘要评估器输出

数据集

设置评估

分析实验结果

标注与人工反馈

常见数据类型

​基本示例

​摘要评估器参数

​摘要评估器输出

基本示例

摘要评估器参数

摘要评估器输出