PRD Agent:先跑通,再面对“效果等于没有”
想搞 AI 练练手,我用已有 PRD 作为知识库,沿着 RAG 路线做了一个查询 Agent。目前链路已经跑通:能检索 chunk,再交给大模型回答。但是效果还很差,要优化的地方很多。
真实进度:这次完成的是知识切分、检索、上下文组装和模型回答的完整链路,也更清楚地看到了评测、召回与排序问题。
BUILD · SHARE · ITERATE
记录各种灵光一现的想法,并努力把它们变成现实。欢迎大家互动,有兴趣参与也欢迎联系我!
不写包装式介绍,只记录做过什么、学到了什么,以及还没解决的问题。
想搞 AI 练练手,我用已有 PRD 作为知识库,沿着 RAG 路线做了一个查询 Agent。目前链路已经跑通:能检索 chunk,再交给大模型回答。但是效果还很差,要优化的地方很多。
真实进度:这次完成的是知识切分、检索、上下文组装和模型回答的完整链路,也更清楚地看到了评测、召回与排序问题。
P 是查准率,R 是查全率。资源有限时两者像跷跷板:查得更准可能漏掉更多,查得更全也可能带回无关内容。癌症筛查应优先查全率;检索具体问题时则要优先保证返回内容准确。
从产品视角看,幻觉往往与上下文查准率不足有关。不同业务需要主动取舍:有时宁愿少回答,也要减少无依据的回答。
先把文档切成 chunk,检索相关内容,再 rerank,最后把最相关的 context 交给模型回答。
生产流程:构建真实测试集;用裁判模型评测 Faithfulness、Precision、Recall、Relevancy;上线后用满意度、点击率等用户指标判断效果。
有合作意向?或想交流开发经验?随时联系我