跳到主要内容

文档索引

在以下地址获取完整的文档索引:https://docs.langchain.org.cn/llms.txt

在进一步探索之前,请使用此文件发现所有可用页面。

LangSmith Polly 是一个直接嵌入在您的 LangSmith 工作区中的 AI 助手,旨在帮助您分析和理解应用程序数据。 Polly 能够帮助您从追踪记录、会话线程和提示词中获取洞察,而无需手动挖掘数据。通过询问自然语言问题,您可以快速了解 Agent 的性能、调试问题并分析用户情感。 LangSmith Polly icon Polly 出现在 LangSmith UI 以下位置的右下角:

可观测性与调试:
  • 项目:浏览和筛选项目中的运行记录。
  • 追踪页面:分析单个运行记录和执行追踪。
  • 会话视图:理解对话线程和用户交互。
提示词工程 评估与测试 Polly chat in the sidebar on a dataset view.

入门

在使用 Polly 之前,您需要为您使用的模型添加 API 密钥: LangSmith UI 中,确保您的 API 密钥已设置为工作区密钥
  1. 导航至 设置,然后转到密钥选项卡。
  2. 选择 添加密钥 并输入密钥环境变量(例如 OPENAI_API_KEYANTHROPIC_API_KEY)以及您的 API 密钥作为
  3. 选择保存密钥
在 LangSmith UI 中添加工作区密钥时,请确保密钥与您的模型提供商预期的环境变量名称匹配。

支持的模型

Polly 开箱即支持以下模型提供商:
  • Anthropic (Claude)
  • OpenAI
  • Google Gemini
  • AWS Bedrock
  • Groq
  • Mistral
  • xAI
  • DeepSeek
  • Fireworks AI
您还可以通过在Playground 设置中启用“在 Polly 中可用”开关,使用您配置的任何自定义模型。工作区管理员可管理哪些自定义模型可用。

键盘快捷键

操作MacWindows/Linux
切换 Polly 开/关Cmd+ICtrl+I
清除当前会话Cmd+Shift+OCtrl+Shift+O

可观测性

项目

在项目的运行记录列表中,Polly 可以浏览和筛选整个项目的运行记录,创建数据集并添加示例。使用 Polly 可以快速探索追踪记录中发生的情况,而无需手动分页查看结果。 示例问题:
  • “向我展示过去 24 小时内所有失败的运行记录”
  • “哪些运行记录耗时最长?”
  • “将失败的运行记录添加到我的测试数据集中”
  • “本周有多少次运行记录报错?”

追踪页面

在单个追踪记录中,Polly 会分析运行记录数据和执行轨迹。Polly 会检查完整的追踪上下文,包括运行元数据、输入、输出、中间步骤和配置,以帮助您了解发生了什么并确定改进方向。 示例问题:
  • “Agent 在这里还有什么可以做得更好的吗?”
  • “为什么这次运行失败了?”
  • “这次追踪中耗时最长的是什么?”
  • “总结这次追踪中发生的事情”

会话视图

在“会话”选项卡下,Polly 会分析对话线程,以帮助您了解用户情感、对话结果和交互模式。使用 Polly 来识别用户痛点并了解问题是否得到解决。 示例问题:
  • “用户看起来沮丧吗?”
  • “用户遇到了什么问题?”
  • “用户的问题解决了吗?”
  • “这个对话线程的主要议题是什么?”

提示词工程

Playground(实验场)

Playground 中,Polly 帮助您编辑和优化提示词。使用自动化选项,如“优化提示词”、“生成工具”或“生成输出架构”,或者为 Polly 提供自定义指令来编辑您的提示词。Polly 可以直接修改 Playground 状态——更新消息、工具、输出架构和示例——让您可以以对话方式迭代提示词。 示例问题:
  • “让它用意大利语回复”
  • “添加更多关于用户角色的背景信息”
  • “让语气更专业一些”
  • “简化指令”

提示词中心页面

当在 LangSmith 中心查看提示词时,Polly 帮助您理解提示词的结构、消息、工具和配置。这对于探索和学习共享提示词非常有用。 示例问题:
  • “这个提示词是做什么的?”
  • “这个提示词使用了哪些工具?”
  • “解释这个提示词的结构”
  • “这个提示词的关键指令是什么?”

评估

数据集实验

在“数据集”页面的“实验”选项卡下,Polly 分析实验结果并帮助您比较不同实验之间的运行记录。Polly 可以识别模式、总结性能,并帮助您理解哪些方法效果最好。 示例问题:
  • “哪个实验表现最好?”
  • “这些运行记录之间的主要区别是什么?”
  • “总结这个实验的结果”
  • “你在失败中看到了什么模式?”

数据集示例

在“数据集”页面的“示例”选项卡下,Polly 帮助您理解数据集结构、浏览示例并识别数据模式。这对于了解您正在处理的数据以及为实验准备数据集非常有用。 示例问题:
  • “这个数据集里是什么类型的数据?”
  • “展示给我看有错误的示例”
  • “你在输入数据中看到了什么模式?”
  • “这个数据集里有多少个示例?”

标注队列

在“标注队列”中,Polly 帮助您在做出标注决策前分析运行记录。无论您是在逐个审查运行记录还是进行两两比较,Polly 都能提供关于运行行为、错误和执行模式的洞察,从而为您的评分提供参考。 示例问题:
  • “这次运行出了什么问题?”
  • “总结这次运行发生的情况”
  • “比较这两次运行记录”
  • “我在评分时应该考虑什么?”

评估器

在“评估器”构建器中,Polly 帮助您编写和优化评估逻辑。Polly 可以生成评估器代码、建议改进方案,并帮助您根据示例测试您的评估器。 示例问题:
  • “编写一个检查幻觉的评估器”
  • “提高这个评估器的准确性”
  • “这个评估器检查什么?”
  • “添加对边缘情况的处理”

接下来做什么

了解更多 Polly 助您探索的功能

可观测性

了解关于追踪和监控 LLM 应用程序的更多信息

线程

理解 LangSmith 中的线程工作原理

提示词工程

在 Playground 中创建并迭代提示词

评估

系统性地评估和测试您的应用程序

© . This site is unofficial and not affiliated with LangChain, Inc.