AI 六边形能力图
分值来自 GitHub 项目与历史学习记录的阶段性判断,用来明确下一步投入,不代表考试成绩。
BUILD · SHARE · ITERATE
记录各种灵光一现的想法,并努力把它们变成现实。欢迎大家互动,有兴趣参与也欢迎联系我!
FROM E-COMMERCE PM TO AI PM
从 TikTok Shop 电商产品实践出发,系统补齐模型原理、RAG、Agent、后训练与多模态,并用一个可上线的电商 AI Copilot 完成四个月闭环。
正在从手搓 Self-Attention 进入完整 Transformer Block;同时用真实 Bad Case 推进分层检索、重排与证据评测。
每周固定复盘:学到了什么、做出了什么、下周改什么。
不是“懂术语”,而是能定义场景、搭出原型、建立评测并推动真实业务结果。
分值来自 GitHub 项目与历史学习记录的阶段性判断,用来明确下一步投入,不代表考试成绩。
代码、对话与上线结果共同构成当前能力基线。
不写包装式介绍,只记录做过什么、学到了什么,以及还没解决的问题。
想搞 AI 练练手,我用已有 PRD 作为知识库,沿着 RAG 路线做了一个查询 Agent。目前链路已经跑通:能检索 chunk,再交给大模型回答。但是效果还很差,要优化的地方很多。
真实进度:这次完成的是知识切分、检索、上下文组装和模型回答的完整链路,也更清楚地看到了评测、召回与排序问题。
P 是查准率,R 是查全率。资源有限时两者像跷跷板:查得更准可能漏掉更多,查得更全也可能带回无关内容。癌症筛查应优先查全率;检索具体问题时则要优先保证返回内容准确。
从产品视角看,幻觉往往与上下文查准率不足有关。不同业务需要主动取舍:有时宁愿少回答,也要减少无依据的回答。
先把文档切成 chunk,检索相关内容,再 rerank,最后把最相关的 context 交给模型回答。
生产流程:构建真实测试集;用裁判模型评测 Faithfulness、Precision、Recall、Relevancy;上线后用满意度、点击率等用户指标判断效果。
有合作意向?或想交流开发经验?随时联系我