Feature/eval optimize loop - #221
Conversation
仅实现 Pipeline 配置校验和 Prompt 隔离工作区创建,不执行实际评测、提示词优化、Gate 或报告生成。
添加 Prompt 感知的 fake agent 与确定性候选提供器。 完成 baseline/candidate 的 train/validation 四次评测,并补充输入漂移保护和离线回归测试。
AI Code Review我已经完成了全面审查。让我来撰写最终的审查结论。 发现的问题
|
|
这里提几个建议: 这样用户看起来比较方便,期望按照这种方式整理代码,数据类的专门放在data目录中 |
| @@ -0,0 +1,125 @@ | |||
| # Evaluation + Optimization Pipeline 实施阶段路线图 | |||
|
|
|||
There was a problem hiding this comment.
这个文档建议放在examples/optimization/eval_optimize_loop目录下
关联 Issue
Closes #91
变更说明
本 PR 实现 Evaluation + Optimization 自动回归与提示词优化闭环,覆盖离线验证、Trace 回放和真实模型集成三种运行方式。
主要流程:
主要能力
AgentOptimizer(update_source=False),候选生成期间不直接修改源 Prompt。运行模式
offline:真实LlmAgent配合确定性模型和确定性评测规则。trace:回放预录制轨迹,不执行 Agent。real:真实业务模型配合真实AgentOptimizer反思模型。真实模式必须显式传入
--run-real,连接信息从环境变量读取,优化模型参数通过命令行参数传入。测试覆盖
执行:
pytest -q tests/evaluation/test_eval_optimize_loop_*.py本功能相关测试全部通过。