什么是 Guardrails
Guardrail 是一组规则和检查机制,旨在确保 LLM 的输出准确、适当,并与用户期望保持一致。
输入 Guardrails
- Topical guardrails:识别偏离主题的问题并给出引导
- Jailbreaking:检测用户试图劫持 LLM 的行为
- Prompt injection:识别隐藏的攻击性代码
输出 Guardrails
- Hallucination guardrails:使用事实核查阻止幻觉
- Moderation guardrails:应用品牌和企业准则
- Format guardrails:确保输出格式正确
实现方案
def check_input(user_input):
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "system", "content": SYSTEM_PROMPT}, {"role": "user", "content": user_input}]
)
return json.loads(response.choices[0].message.content)
最佳实践
- 建立全面的评估数据集
- 使用少样本提示增强检测准确性
- 并行执行输入和输出检查以减少延迟
- 定期更新 guardrail 规则