Playground 使用指南
Playground 是 AnideaAI 的在线调试台,适合在接入代码前先验证模型效果、参数和提示词。
入口:https://anideaai.com/playground
适合哪些场景
- 新需求立项前做模型选型
- 上线前验证提示词是否稳定
- 排查线上结果异常(先在 Playground 复现)
- 对比不同模型在同一输入下的输出差异
5 分钟上手
- 登录控制台后进入 Playground
- 选择目标模型
- 输入系统提示词和用户问题
- 调整参数(温度、最大输出长度等)
- 发送请求并观察结果、耗时和用量
页面区域说明
1. 输入区
- 系统提示词:定义角色、语气、边界
- 用户消息:当前提问内容
- 历史消息:模拟多轮上下文
2. 参数区
- 温度:数值越高越发散,越低越稳定
- 采样范围:控制输出候选分布
- 最大输出长度:限制模型最大回复长度
- 频率惩罚:降低重复表达概率
3. 输出区
- 模型回复正文
- 请求耗时
- 用量统计(便于估算成本)
参数调优建议
场景 A:知识问答(重准确)
- 温度设置偏低
- 提示词写清楚回答格式
- 限制输出长度,避免跑题
场景 B:文案创作(重多样)
- 温度适当提高
- 增加风格示例
- 一次生成多版候选后人工筛选
场景 C:结构化输出(重可解析)
- 在提示词里明确字段结构
- 要求只输出约定格式
- 先在 Playground 连续测试 10 次稳定性
常用测试模板
1. 模型横向对比
- 固定同一输入
- 仅切换模型
- 记录质量、耗时、成本三项结果
2. 提示词迭代
- 从最简提示词开始
- 每次只改一个变量
- 保存版本,避免回退困难
3. 稳定性测试
- 准备 20 条代表性样例
- 连续运行并记录异常率
- 对异常样例做针对性修正
从 Playground 到代码
调试完成后,建议把以下信息同步到业务代码:
- 最终模型名
- 关键提示词模板
- 关键参数组合
- 超时与重试策略
最小可运行请求示例:
curl https://anideaai.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-xxxxx" \
-d '{
"model": "gpt-5.4",
"temperature": 0.4,
"messages": [
{"role": "system", "content": "你是企业客服助理,回答要简洁可执行。"},
{"role": "user", "content": "给出订单延迟的安抚话术"}
]
}'
常见问题
1. Playground 输出很好,线上效果却变差
通常是线上上下文、参数、系统提示词与 Playground 不一致。先做配置对齐,再看模型差异。
2. 为什么同样输入每次结果不完全一样
只要温度大于 0,模型就可能出现差异。需要稳定输出时可适当降低温度。
3. 如何控制测试成本
先用低成本模型做提示词迭代,确认方案后再切换到目标模型验收。