如何评估可运行组件

设置
评估
相关

langchain: Python 和 JS/TS
Runnable: Python 和 JS/TS

langchain Runnable 对象（例如聊天模型、检索器、链等）可以直接传入 evaluate() / aevaluate()。

设置

让我们定义一个简单的链进行评估。首先，安装所有必需的包

pip install -U langsmith langchain[openai]

现在定义一个链

from langchain.chat_models import init_chat_model
from langchain_core.prompts import ChatPromptTemplate
from langchain_core.output_parsers import StrOutputParser

instructions = (
    "Please review the user query below and determine if it contains any form "
    "of toxic behavior, such as insults, threats, or highly negative comments. "
    "Respond with 'Toxic' if it does, and 'Not toxic' if it doesn't."
)

prompt = ChatPromptTemplate(
    [("system", instructions), ("user", "{text}")],
)

model = init_chat_model("gpt-4o")
chain = prompt | model | StrOutputParser()

评估

要评估我们的链，我们可以直接将其传递给 evaluate() / aevaluate() 方法。请注意，链的输入变量必须与示例输入的键匹配。在这种情况下，示例输入应采用 {"text": "..."} 的形式。

from langsmith import aevaluate, Client

client = Client()

# Clone a dataset of texts with toxicity labels.
# Each example input has a "text" key and each output has a "label" key.
dataset = client.clone_public_dataset(
    "https://smith.langchain.com/public/3d6831e6-1680-4c88-94df-618c8e01fc55/d"
)

def correct(outputs: dict, reference_outputs: dict) -> bool:
    # Since our chain outputs a string not a dict, this string
    # gets stored under the default "output" key in the outputs dict:
    actual = outputs["output"]
    expected = reference_outputs["label"]
    return actual == expected

results = await aevaluate(
    chain,
    data=dataset,
    evaluators=[correct],
    experiment_prefix="gpt-4o, baseline",
)

可运行组件的每次输出都会进行相应的跟踪。

如何评估 langgraph 图

在 GitHub 上编辑此页面源文件。

以编程方式连接这些文档到 Claude、VSCode 等，通过 MCP 获取实时答案。

如何在本地运行评估（仅限 Python）

如何评估图

⌘I

数据集

设置评估

分析实验结果

标注与人工反馈

常见数据类型

设置

评估

数据集

设置评估

分析实验结果

标注与人工反馈

常见数据类型

​设置

​评估

​相关

设置

评估

相关