智能体业务反馈自进化闭环解决方案
本文给出一类通用方案:业务人员在智能体上评判预测/推荐结果 → 平台结构化记录反馈 → 结合规则、统计决策与大模型编排,驱动校准、路由或重训,使效果「越用越好」。适用于已具备机器学习预测流水线与 HTTP 接口、由智能体平台负责反馈采集与决策编排的落地形态。文中案例均已抽象化,不对应特定客户或产品线。
目录
一、需求背景与目标
1.1 业务诉求
| 环节 | 说明 |
|---|
| 前提 | 业务侧提供机器学习预测流水线及接口(超参模板、模型切换、重训练等) |
| 使用与评判 | 业务人员在智能体上使用系统,对结果做评判(好 / 一般 / 差)并填写反馈(偏差方向、期望区间等) |
| 记录 | 平台结构化落库,并与当次预测上下文(request_id、模型版本、特征快照等)全链路关联 |
| 利用与提升 | 评判与反馈经结构化与统计决策,驱动校准、路由或重训,持续改善预测效果 |
| 目标 | 在无需技术人员手工调参的前提下,结果「越用越好」 |
1.2 核心判断
方向可行,但需分层、分阶段:
| 层级 | 无人值守空间 | 说明 |
|---|
| L1 体验层自进化 | 可较快实现 | 反馈 → 解释优化、展示校准、置信度提示、人工复核路由 |
| L2 模型层自进化 | 需严格护栏 | 反馈 → 重训 / 切模 / 调参,必须有回测、灰度、回滚 |
对「错误改动直接影响业务决策」的场景,L2 不宜完全无人审批。更稳妥的定义是:业务反馈驱动 + 系统自动提案 + 回测门禁 + 异常时人工一键确认。
1.3 关键原则
- 「好 / 一般 / 差」是主观判断 + 自然语言;ML 侧需要结构化信号(标签、特征、阈值、触发条件)。
- 中间层本质:把主观反馈转为结构化指标与可执行指令,再交给训练/发布流水线。
- LLM 适合:解析补充文本、生成运维报告、辅助归因;不适合:无约束地决定超参、训练或生产上线。
- 更快见效的组合:结构化反馈 + 统计决策(代码)+ 校准 / 路由(快环)+ 回测门禁后的重训(慢环)。
二、总体架构
2.1 三层中间层
1
2
3
4
5
6
7
8
9
10
11
12
| 业务人员 ──评判+反馈──► 智能体平台
│
▼
反馈库 → 结构化解析(规则 + LLM)
│
▼
决策引擎(频率 / 策略,代码)
│
▼ 结构化指令
MLOps 适配插件 ──► 训练流水线 / 模型服务
│
└──► 再服务于智能体询价/问答
|
| 层级 | 职责 | 典型归属 |
|---|
| MLOps / 训练接口层 | 校准、集成权重、重训、版本 promote/rollback、反馈数据集 ingest | 业务侧 ML |
| 决策编排层 | 反馈采集、结构化、聚合统计、阈值判定、触发校准或重训提案 | 智能体平台 |
| 闭环 | 预测 → 反馈 → 决策 → 执行 → 再预测;回测与灰度门禁 | 联合 |
2.2 双环架构
1
2
3
4
5
6
7
| 【快环 · 小时到天】
反馈聚合 → 统计决策 → 校准 offset / 模型路由权重 → 下次请求即生效
【慢环 · 周到月】
足够样本 + 稳定模式 → 提交重训 → Staging → 回测门禁 → 灰度 promote / rollback
反馈库同时喂入快环与慢环;慢环成功后可替换底层模型并逐步减弱快环校准。
|
- 快环:不改模型权重,调输出校准或集成路由;分钟~天内生效。
- 慢环:带反馈数据集重训;必须过回测门禁后再灰度上线。
2.3 职责边界
| 能力 | 智能体平台 | 业务侧 ML |
|---|
| 反馈 UI、会话内评判、反馈库 | ✓ | |
| 场景化反馈模板(Schema) | ✓ | |
| 反馈结构化(LLM enrich + 规则校验) | ✓ | |
| 聚合统计、决策工作流(代码) | ✓ | |
| MLOps 适配插件(调训练侧 API) | ✓ | |
| 重训、超参搜索、模型注册 | | ✓ |
| 回测门禁、生产发布 | | ✓(平台编排调用) |
| 反馈写入训练集 | | ✓(提供 ingest API) |
| 业务校准 API、集成权重 API | | ✓ |
平台建设的是 「业务反馈闭环 + Model Ops 编排层」,不越界到模型本体开发与训练。
2.4 反馈提升 ML 的四条路径
| 路径 | 机制 | 适用 |
|---|
| A. 人类反馈 → 监督信号 | 特征快照 + 预测值 + 评分/期望区间/真实结果 → 重训数据集 | 慢环;有真实成交或实测时效果最好 |
| B. 反馈 → 后处理校准 | 按区域 / 品类 / 客户层做 bias correction | 快环;系统性偏高/偏低 |
| C. 反馈 → 数据/特征质量 | 「外部参考不对」「数据偏旧」→ 数据质量告警 | 根因在数据而非模型 |
| D. 反馈 → 模型路由/集成 | 某场景差评率高 → 切换子模型或调整集成权重 | 多模型库;比全量重训成本低 |
三、MLOps 接口契约
接口应有限、可审计,不建议暴露「任意改超参」。
| 接口类型 | 用途 | 调用方 |
|---|
POST /calibration/upsert | 按场景写入输出偏移等业务校准 | 决策工作流(快环) |
POST /ensemble/weight | 调整多模型集成权重 | 决策工作流(快环) |
POST /feedback/ingest | 批量写入反馈样本供训练消费 | 反馈库同步 |
POST /training/jobs | 按模板提交重训任务 | 决策工作流(慢环) |
GET /training/jobs/{id} | 查询训练进度 | 可视化 / 报告 |
POST /models/promote | Staging → Production(支持 canary) | 回测通过后 |
POST /models/rollback | 回滚版本 | 告警 / 偏移超阈值 |
GET /models/versions | 版本列表与指标 | 展示 + 决策输入 |
POST /backtest/run | 新模型 vs 基线回测 | 回测能力扩展 |
统一要求:鉴权、重试、Request-Id 透传、超时策略。
四、完整链路示例
以下用一次抽象询价贯穿全流程(数值与地区均为示意)。
4.1 场景设定
| 项 | 示意值 |
|---|
| 角色 | 区域业务人员 |
| 提问 | 「区域 A、品类 X、客户层级 S,下周推荐值是多少?」 |
| request_id | req-20260630-8f3a |
| slice | region=A / product=X / tier=S |
| model_version | model-main-v2.3.1 |
| recommended | 6850(业务单位) |
| feature_snapshot_id | feat-snap-99102 |
4.2 业务反馈(场景化结构化采集)
答复卡片底部:「这次建议准吗?」→ 自动匹配模板 TPL_VALUE_RECOMMEND。
| 结构化字段 | 填写 |
|---|
| 总体评价 | 差 |
| 偏差方向 | 偏高 |
| 偏差量级 | 约 80~120 |
| 怀疑原因 | 外部参考动态、客户特殊性 |
| 期望区间 | 6730~6780 |
| 补充说明 | 「上周刚谈成 6750,客户说市场参考更低」 |
立即落库(不等待 LLM):
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
| {
"feedback_id": "fb-004821",
"request_id": "req-20260630-8f3a",
"template_id": "TPL_VALUE_RECOMMEND",
"rating": "poor",
"structured": {
"bias_direction": "high",
"bias_range": [80, 120],
"suspected_causes": ["external_ref", "customer_special"],
"expected_range": [6730, 6780]
},
"free_text": "上周刚谈成6750...",
"prediction_context": {
"region": "A",
"product": "X",
"tier": "S",
"recommended": 6850,
"model_version": "model-main-v2.3.1",
"feature_snapshot_id": "feat-snap-99102"
}
}
|
4.3 LLM 补充解析(辅助,非决策)
异步解析 free_text,输出固定 Schema,例如提到参考成交价 6750、置信度 0.92,合并进结构化字段。
LLM 不做:决定重训、改推荐值、调超参。
4.4 统计决策(纯代码,定时聚合)
按切片键聚合近 7 日:差评率 26.7%、偏高占比 83%、平均偏高约 +95。
1
2
3
4
5
6
7
8
9
10
11
12
13
14
| fast_loop:
calibration:
min_feedback_count: 10
poor_rate_threshold: 0.20
high_bias_ratio_threshold: 0.70
action: APPLY_CALIBRATION
delta: -median(estimated_bias)
slow_loop:
retrain_proposal:
min_feedback_count: 30
poor_rate_threshold: 0.25
action: PROPOSE_RETRAIN
status: pending_backtest_gate
|
决策单示意:对该切片应用 price_offset: -95,并提案重训(待回测门禁)。
4.5 快环 — 校准
1
2
3
4
5
6
7
8
9
10
| POST /api/v1/calibration/upsert
Content-Type: application/json
{
"scope": { "region": "A", "product": "X", "tier": "S" },
"output_offset": -95,
"source": "feedback_loop",
"decision_id": "dec-20260701-001",
"expires_at": "2026-07-15"
}
|
下次同场景:6850 + (-95) = 6755,落入期望区间。展示层可引用校准元数据,不编造数值来源。
多模型时可改调集成权重作为备选快环。
4.6 快环效果验证
数日后同一切片:原始输出约 6840,校准后约 6745,评判升为「一般」。差评率下降则暂不加大校准,避免过调。
4.7 慢环 — 重训 + 回测 + 灰度
提交重训 job(附反馈数据集引用)→ 新版本进入 Staging → 调用回测 API(相对基线的误差、差评代理指标、策略偏移、合规违规)。
三叉门禁须同时满足,例如:
| 条件 | 阈值示意 |
|---|
| backtest.passed | true |
| 核心误差改善 | ≥ 10% |
| strategy_drift | < 0.05 |
| compliance_violations | = 0 |
通过后 canary promote(如区域 A、30% 流量);监控窗口内差评率回升则自动 rollback。未通过则拒绝上线,保留快环校准。
4.8 端到端时序
1
2
3
4
5
6
7
8
| 业务人员 → 智能体:询价得到 6850
业务人员 → 智能体:差评 + 结构化反馈
智能体 → 反馈库:落库;异步 LLM enrich
[定时] 决策引擎读切片统计
→ 快环:写校准 offset -95(次日询价约 6755)
→ 慢环:提交重训 → 回测通过 → 灰度 promote
业务人员再次询价:新模型 + 可能减弱的校准
|
五、场景化反馈模板
5.1 为何按场景预设
同一句「差」在不同场景含义不同:推荐值偏差、博弈结论不合理、竞品/外部参考不准、任务建议不可执行等。一套表单打天下会导致字段对不上、统计失真、校准加错对象。
5.2 自动匹配
1
| 意图类型 + 输出结果类型 + 可选业务子类型 → template_id
|
| 触发条件(示意) | 模板 ID | 名称 |
|---|
| 基础推荐,输出含推荐值 | TPL_VALUE_RECOMMEND | 推荐值反馈 |
| 多轮博弈 / 调价可行性 | TPL_NEGOTIATION_ROUND | 博弈轮次反馈 |
| 主指标为销量/量级预测 | TPL_VOLUME_FORECAST | 量级预测反馈 |
| 主指标为外部参考价 | TPL_EXTERNAL_REF | 外部参考反馈 |
| 任务进度 / 策略建议 | TPL_TASK_PROGRESS | 进度建议反馈 |
| 区域批量方案 | TPL_REGION_BATCH | 区域方案反馈 |
| 未匹配 | TPL_GENERIC | 通用反馈(兜底) |
5.3 推荐值模板字段(核心)
| 字段 | 字段名 | 说明 |
|---|
| 总体评价 | rating | good / fair / poor |
| 主要问题 | main_issues | 偏高、偏低、波动大、与近况不一致、与客户实情不符、外部参考不准等 |
| 偏差方向 | bias_direction | high / low / reasonable |
| 偏差量级 | bias_magnitude | 分档枚举 |
| 期望区间 | expected_range | 可选数字区间 |
| 参考依据 | reference_basis | 近成交、客户报价、外部挂牌、经验等 |
| 补充说明 | free_text | 可选,限长 |
联动:rating=good 可一键提交;rating=poor 时问题与偏差方向必填。
其他模板按场景裁剪字段(量级偏差百分比、哪部分不准、外部参考来源、区域结构问题等)。任务进度类一般只优化解释与报告,不触发重训。
5.4 模板三层配置
| 层级 | 内容 | 维护 |
|---|
| 平台级 | Schema、字段枚举、intent 映射 | 平台 |
| 业务级 | 枚举文案、品类/区域编码 | 可配置知识 |
| 会话级 | 本轮推荐值、模型版本、request_id 只读预填 | 工作流自动 |
5.5 与快慢环路由
| 模板 | 快环 | 慢环 |
|---|
| 推荐值 | 输出 offset 校准 | 相关模型重训 |
| 量级预测 | 一般不做价格类校准 | 量级模型重训/加权 |
| 外部参考 | 展示层修正(若有) | 参考模型重训 |
| 博弈轮次 | 按字段分流 | 带真实结果入训 |
| 任务进度 | 无 | 无(改解释) |
决策以 template_id 分流,避免把「外部参考不准」误计入「推荐值偏高」。
六、智能体平台工程实现
6.1 工作流扩展
在主工作流与子工作流之外,建议增加:
| 流程 | 职责 | 节点类型 |
|---|
| 反馈采集 | 渲染模板、校验、落库 | UI + 代码 |
| 反馈 enrich | LLM 解析 free_text | LLM |
| 反馈决策(定时) | 聚合、规则判定、输出 decision | 纯代码 |
| 快环执行 | 调 calibration / ensemble API | HTTP 插件 |
| 慢环编排 | 提交 training job、轮询进度 | HTTP 插件 |
| 回测门禁 | 新模型必须通过方可 promote | 回测插件 |
| 灰度与回滚 | promote / rollback | HTTP 插件 |
6.2 结果包扩展
出口在 answer 之外增加 feedback 块:enabled、template_id、预填字段、context_ref(request_id、模型版本、特征快照等)。
6.3 反馈提交 API
1
| POST /api/v1/feedback/submit
|
按 JSON Schema 校验;失败提示补全,不让 LLM 猜测结构化字段。
6.4 插件与可视化
- MLOps 插件:校准、集成、训练任务、promote/rollback
- 反馈同步插件(可选):ingest 至训练侧
- Dashboard:反馈洞察(差评率趋势、偏差方向分布、校准记录、训练/回测/灰度状态)
七、决策规则与门禁
7.1 快环规则示例
1
2
3
4
5
6
7
8
9
10
11
| fast_loop:
calibration:
enabled: true
slice_by: [region, product, tier, model_version]
min_feedback_count: 10
window_days: 7
poor_rate_threshold: 0.20
high_bias_ratio_threshold: 0.70
delta_formula: "-median(estimated_bias)"
max_abs_offset: 200
default_expiry_days: 14
|
7.2 慢环规则示例
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
| slow_loop:
retrain_proposal:
enabled: true
min_feedback_count: 30
window_days: 7
poor_rate_threshold: 0.25
backtest_gate:
error_improvement_min: -0.10
strategy_drift_max: 0.05
compliance_violations_max: 0
canary:
initial_traffic_percent: 30
monitor_hours: 48
poor_rate_regression_threshold: 0.05
auto_rollback: true
|
7.3 三叉门禁
自动 promote 须同时满足:回测通过、核心指标改善、策略偏移与合规在阈值内。否则拒绝上线,保留快环,生成运维报告,可选人工确认。
八、分阶段实施
| 阶段 | 内容 | 业务价值 | 依赖 |
|---|
| P0 | 场景模板 + 表单 + 落库;全链路 ID 关联 | 可观测、可积累 | 平台 |
| P1 | 反馈看板;聚合报告;enrich | 业务与数据科学对齐 | 平台 |
| P2 | 决策定时流;快环校准 API 联调 | 数天内可感知改善 | 校准 API |
| P3 | 慢环训练 + 回测门禁 + 灰度 | 模型层自进化 | 训练/回测 API |
| P4 | feedback ingest 入训;集成自动调权 | 更完整的慢环 | 流水线成熟 |
建议首期上线 P0~P2,慢环与试运行并行。
九、风险与应对
| 风险 | 应对 |
|---|
| 少量情绪化差评导致误校准 | 最小样本量;滑动窗口;校准上限与过期 |
| LLM 解析错误 | 仅 enrich;表单字段为准;低置信度不入决策 |
| 快环与慢环冲突 | 新模型上线后逐步减弱或撤销对应 offset |
| 业务不愿填表 | 「好」一键;「差」才展开;预填上下文 |
| MLOps API 未就绪 | P0/P1 先积累;Mock 校准;并联定义 OpenAPI |
| 自动上线引发业务风险 | 三叉门禁 + 灰度 + 自动 rollback;异常人工确认 |
| 反馈与真实结果偏差大 | 博弈类模板收集真实结果;慢环样本加权 |
不推荐做法
- LLM 直接决定超参或生产上线
- 无版本、无回滚的「自进化」
- 每条差评立即触发重训
- 平台方越界自建完整训练流水线(与职责边界冲突)
十、小结
| 要点 | 结论 |
|---|
| 建设边界 | 平台:反馈层 + 决策编排 + MLOps 插件;业务侧 ML:训练 / 发布 / 校准 API |
| 数据基础 | 场景化反馈模板;结构化可统计;自由文本仅作 LLM 补充 |
| 双环 | 快环(校准/路由)数天内见效;慢环(重训+回测+灰度)提升底层模型 |
| 角色分工 | 统计决策用代码、执行用 API、解释用 LLM;预测数值禁止臆造 |
| 「零技术人员」 | 指零手工调参、零写代码;保留回测强制与异常人工确认 |
附录 A:Schema 草案
A.1 TPL_VALUE_RECOMMEND(节选)
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
| {
"$id": "TPL_VALUE_RECOMMEND",
"version": "1.0",
"type": "object",
"required": ["rating"],
"properties": {
"rating": { "enum": ["good", "fair", "poor"] },
"main_issues": {
"type": "array",
"items": {
"enum": [
"too_high", "too_low", "volatility",
"inconsistent_with_recent", "mismatch_customer",
"external_ref_wrong", "unclear"
]
}
},
"bias_direction": { "enum": ["high", "low", "reasonable"] },
"bias_magnitude": { "enum": ["lt_30", "30_80", "80_150", "gt_150"] },
"expected_range": {
"type": "array", "items": { "type": "number" }, "minItems": 2, "maxItems": 2
},
"free_text": { "type": "string", "maxLength": 200 }
}
}
|
A.2 反馈记录统一结构(存储)
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
| {
"feedback_id": "string",
"request_id": "string",
"session_id": "string",
"user_id": "string",
"timestamp": "date-time",
"template_id": "string",
"template_version": "string",
"rating": "string",
"structured": "object",
"free_text": "string",
"llm_enriched": "object",
"prediction_context": {
"region": "string",
"product": "string",
"tier": "string",
"recommended": "number",
"model_version": "string",
"feature_snapshot_id": "string"
}
}
|