Prompt 结构
Prompt 不是咒语,而是接口。它应该包含任务目标、输入格式、输出约束、拒绝边界、示例和质量标准。复杂任务还需要把推理步骤转化为可验证的中间结果。
RAG 数据管道
RAG 质量取决于数据,而不是只取决于模型。文档清洗、切分粒度、元数据、召回策略、重排和引用追踪都会影响答案可信度。
清洗去掉导航、页脚、重复段落和失效内容。
切分按语义块切分,保留标题层级和来源。
召回结合关键词、向量和过滤条件。
评测用固定问题集持续检测召回率和幻觉率。
Agent 与工具调用
Agent 适合处理需要多步计划、外部工具和动态反馈的任务。设计时要限制权限、记录工具输入输出,并为高风险动作加入确认和回滚机制。
评测与成本
上线前至少准备三类评测:正确性、稳定性和成本。正确性看答案是否满足需求,稳定性看多次运行是否一致,成本看 token、延迟和外部工具调用是否可接受。