文章

智能体业务反馈自进化闭环解决方案

智能体业务反馈自进化闭环解决方案

智能体业务反馈自进化闭环解决方案

本文给出一类通用方案:业务人员在智能体上评判预测/推荐结果 → 平台结构化记录反馈 → 结合规则、统计决策与大模型编排,驱动校准、路由或重训,使效果「越用越好」。适用于已具备机器学习预测流水线与 HTTP 接口、由智能体平台负责反馈采集与决策编排的落地形态。文中案例均已抽象化,不对应特定客户或产品线。


目录


一、需求背景与目标

1.1 业务诉求

环节说明
前提业务侧提供机器学习预测流水线及接口(超参模板、模型切换、重训练等)
使用与评判业务人员在智能体上使用系统,对结果做评判(好 / 一般 / 差)并填写反馈(偏差方向、期望区间等)
记录平台结构化落库,并与当次预测上下文(request_id、模型版本、特征快照等)全链路关联
利用与提升评判与反馈经结构化与统计决策,驱动校准、路由或重训,持续改善预测效果
目标无需技术人员手工调参的前提下,结果「越用越好」

1.2 核心判断

方向可行,但需分层、分阶段:

层级无人值守空间说明
L1 体验层自进化可较快实现反馈 → 解释优化、展示校准、置信度提示、人工复核路由
L2 模型层自进化需严格护栏反馈 → 重训 / 切模 / 调参,必须有回测、灰度、回滚

对「错误改动直接影响业务决策」的场景,L2 不宜完全无人审批。更稳妥的定义是:业务反馈驱动 + 系统自动提案 + 回测门禁 + 异常时人工一键确认

1.3 关键原则

  1. 「好 / 一般 / 差」是主观判断 + 自然语言;ML 侧需要结构化信号(标签、特征、阈值、触发条件)。
  2. 中间层本质:把主观反馈转为结构化指标与可执行指令,再交给训练/发布流水线。
  3. LLM 适合:解析补充文本、生成运维报告、辅助归因;不适合:无约束地决定超参、训练或生产上线。
  4. 更快见效的组合:结构化反馈 + 统计决策(代码)+ 校准 / 路由(快环)+ 回测门禁后的重训(慢环)。

二、总体架构

2.1 三层中间层

1
2
3
4
5
6
7
8
9
10
11
12
业务人员 ──评判+反馈──► 智能体平台
                           │
                           ▼
                      反馈库 → 结构化解析(规则 + LLM)
                           │
                           ▼
                      决策引擎(频率 / 策略,代码)
                           │
                           ▼ 结构化指令
                      MLOps 适配插件 ──► 训练流水线 / 模型服务
                                              │
                                              └──► 再服务于智能体询价/问答
层级职责典型归属
MLOps / 训练接口层校准、集成权重、重训、版本 promote/rollback、反馈数据集 ingest业务侧 ML
决策编排层反馈采集、结构化、聚合统计、阈值判定、触发校准或重训提案智能体平台
闭环预测 → 反馈 → 决策 → 执行 → 再预测;回测与灰度门禁联合

2.2 双环架构

1
2
3
4
5
6
7
【快环 · 小时到天】
反馈聚合 → 统计决策 → 校准 offset / 模型路由权重 → 下次请求即生效

【慢环 · 周到月】
足够样本 + 稳定模式 → 提交重训 → Staging → 回测门禁 → 灰度 promote / rollback

反馈库同时喂入快环与慢环;慢环成功后可替换底层模型并逐步减弱快环校准。
  • 快环:不改模型权重,调输出校准或集成路由;分钟~天内生效。
  • 慢环:带反馈数据集重训;必须过回测门禁后再灰度上线。

2.3 职责边界

能力智能体平台业务侧 ML
反馈 UI、会话内评判、反馈库 
场景化反馈模板(Schema) 
反馈结构化(LLM enrich + 规则校验) 
聚合统计、决策工作流(代码) 
MLOps 适配插件(调训练侧 API) 
重训、超参搜索、模型注册 
回测门禁、生产发布 ✓(平台编排调用)
反馈写入训练集 ✓(提供 ingest API)
业务校准 API、集成权重 API 

平台建设的是 「业务反馈闭环 + Model Ops 编排层」,不越界到模型本体开发与训练。

2.4 反馈提升 ML 的四条路径

路径机制适用
A. 人类反馈 → 监督信号特征快照 + 预测值 + 评分/期望区间/真实结果 → 重训数据集慢环;有真实成交或实测时效果最好
B. 反馈 → 后处理校准按区域 / 品类 / 客户层做 bias correction快环;系统性偏高/偏低
C. 反馈 → 数据/特征质量「外部参考不对」「数据偏旧」→ 数据质量告警根因在数据而非模型
D. 反馈 → 模型路由/集成某场景差评率高 → 切换子模型或调整集成权重多模型库;比全量重训成本低

三、MLOps 接口契约

接口应有限、可审计,不建议暴露「任意改超参」。

接口类型用途调用方
POST /calibration/upsert按场景写入输出偏移等业务校准决策工作流(快环)
POST /ensemble/weight调整多模型集成权重决策工作流(快环)
POST /feedback/ingest批量写入反馈样本供训练消费反馈库同步
POST /training/jobs按模板提交重训任务决策工作流(慢环)
GET /training/jobs/{id}查询训练进度可视化 / 报告
POST /models/promoteStaging → Production(支持 canary)回测通过后
POST /models/rollback回滚版本告警 / 偏移超阈值
GET /models/versions版本列表与指标展示 + 决策输入
POST /backtest/run新模型 vs 基线回测回测能力扩展

统一要求:鉴权、重试、Request-Id 透传、超时策略


四、完整链路示例

以下用一次抽象询价贯穿全流程(数值与地区均为示意)。

4.1 场景设定

示意值
角色区域业务人员
提问「区域 A、品类 X、客户层级 S,下周推荐值是多少?」
request_idreq-20260630-8f3a
sliceregion=A / product=X / tier=S
model_versionmodel-main-v2.3.1
recommended6850(业务单位)
feature_snapshot_idfeat-snap-99102

4.2 业务反馈(场景化结构化采集)

答复卡片底部:「这次建议准吗?」→ 自动匹配模板 TPL_VALUE_RECOMMEND

结构化字段填写
总体评价
偏差方向偏高
偏差量级约 80~120
怀疑原因外部参考动态、客户特殊性
期望区间6730~6780
补充说明「上周刚谈成 6750,客户说市场参考更低」

立即落库(不等待 LLM):

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
{
  "feedback_id": "fb-004821",
  "request_id": "req-20260630-8f3a",
  "template_id": "TPL_VALUE_RECOMMEND",
  "rating": "poor",
  "structured": {
    "bias_direction": "high",
    "bias_range": [80, 120],
    "suspected_causes": ["external_ref", "customer_special"],
    "expected_range": [6730, 6780]
  },
  "free_text": "上周刚谈成6750...",
  "prediction_context": {
    "region": "A",
    "product": "X",
    "tier": "S",
    "recommended": 6850,
    "model_version": "model-main-v2.3.1",
    "feature_snapshot_id": "feat-snap-99102"
  }
}

4.3 LLM 补充解析(辅助,非决策)

异步解析 free_text,输出固定 Schema,例如提到参考成交价 6750、置信度 0.92,合并进结构化字段。

LLM 不做:决定重训、改推荐值、调超参。

4.4 统计决策(纯代码,定时聚合)

按切片键聚合近 7 日:差评率 26.7%、偏高占比 83%、平均偏高约 +95。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
fast_loop:
  calibration:
    min_feedback_count: 10
    poor_rate_threshold: 0.20
    high_bias_ratio_threshold: 0.70
    action: APPLY_CALIBRATION
    delta: -median(estimated_bias)

slow_loop:
  retrain_proposal:
    min_feedback_count: 30
    poor_rate_threshold: 0.25
    action: PROPOSE_RETRAIN
    status: pending_backtest_gate

决策单示意:对该切片应用 price_offset: -95,并提案重训(待回测门禁)。

4.5 快环 — 校准

1
2
3
4
5
6
7
8
9
10
POST /api/v1/calibration/upsert
Content-Type: application/json

{
  "scope": { "region": "A", "product": "X", "tier": "S" },
  "output_offset": -95,
  "source": "feedback_loop",
  "decision_id": "dec-20260701-001",
  "expires_at": "2026-07-15"
}

下次同场景:6850 + (-95) = 6755,落入期望区间。展示层可引用校准元数据,不编造数值来源。

多模型时可改调集成权重作为备选快环。

4.6 快环效果验证

数日后同一切片:原始输出约 6840,校准后约 6745,评判升为「一般」。差评率下降则暂不加大校准,避免过调。

4.7 慢环 — 重训 + 回测 + 灰度

提交重训 job(附反馈数据集引用)→ 新版本进入 Staging → 调用回测 API(相对基线的误差、差评代理指标、策略偏移、合规违规)。

三叉门禁须同时满足,例如:

条件阈值示意
backtest.passedtrue
核心误差改善≥ 10%
strategy_drift< 0.05
compliance_violations= 0

通过后 canary promote(如区域 A、30% 流量);监控窗口内差评率回升则自动 rollback。未通过则拒绝上线,保留快环校准。

4.8 端到端时序

1
2
3
4
5
6
7
8
业务人员 → 智能体:询价得到 6850
业务人员 → 智能体:差评 + 结构化反馈
智能体 → 反馈库:落库;异步 LLM enrich

[定时] 决策引擎读切片统计
  → 快环:写校准 offset -95(次日询价约 6755)
  → 慢环:提交重训 → 回测通过 → 灰度 promote
业务人员再次询价:新模型 + 可能减弱的校准

五、场景化反馈模板

5.1 为何按场景预设

同一句「差」在不同场景含义不同:推荐值偏差、博弈结论不合理、竞品/外部参考不准、任务建议不可执行等。一套表单打天下会导致字段对不上、统计失真、校准加错对象。

5.2 自动匹配

1
意图类型 + 输出结果类型 + 可选业务子类型 → template_id
触发条件(示意)模板 ID名称
基础推荐,输出含推荐值TPL_VALUE_RECOMMEND推荐值反馈
多轮博弈 / 调价可行性TPL_NEGOTIATION_ROUND博弈轮次反馈
主指标为销量/量级预测TPL_VOLUME_FORECAST量级预测反馈
主指标为外部参考价TPL_EXTERNAL_REF外部参考反馈
任务进度 / 策略建议TPL_TASK_PROGRESS进度建议反馈
区域批量方案TPL_REGION_BATCH区域方案反馈
未匹配TPL_GENERIC通用反馈(兜底)

5.3 推荐值模板字段(核心)

字段字段名说明
总体评价ratinggood / fair / poor
主要问题main_issues偏高、偏低、波动大、与近况不一致、与客户实情不符、外部参考不准等
偏差方向bias_directionhigh / low / reasonable
偏差量级bias_magnitude分档枚举
期望区间expected_range可选数字区间
参考依据reference_basis近成交、客户报价、外部挂牌、经验等
补充说明free_text可选,限长

联动:rating=good 可一键提交;rating=poor 时问题与偏差方向必填。

其他模板按场景裁剪字段(量级偏差百分比、哪部分不准、外部参考来源、区域结构问题等)。任务进度类一般只优化解释与报告,不触发重训。

5.4 模板三层配置

层级内容维护
平台级Schema、字段枚举、intent 映射平台
业务级枚举文案、品类/区域编码可配置知识
会话级本轮推荐值、模型版本、request_id 只读预填工作流自动

5.5 与快慢环路由

模板快环慢环
推荐值输出 offset 校准相关模型重训
量级预测一般不做价格类校准量级模型重训/加权
外部参考展示层修正(若有)参考模型重训
博弈轮次按字段分流带真实结果入训
任务进度无(改解释)

决策以 template_id 分流,避免把「外部参考不准」误计入「推荐值偏高」。


六、智能体平台工程实现

6.1 工作流扩展

在主工作流与子工作流之外,建议增加:

流程职责节点类型
反馈采集渲染模板、校验、落库UI + 代码
反馈 enrichLLM 解析 free_textLLM
反馈决策(定时)聚合、规则判定、输出 decision纯代码
快环执行调 calibration / ensemble APIHTTP 插件
慢环编排提交 training job、轮询进度HTTP 插件
回测门禁新模型必须通过方可 promote回测插件
灰度与回滚promote / rollbackHTTP 插件

6.2 结果包扩展

出口在 answer 之外增加 feedback 块:enabledtemplate_id、预填字段、context_refrequest_id、模型版本、特征快照等)。

6.3 反馈提交 API

1
POST /api/v1/feedback/submit

按 JSON Schema 校验;失败提示补全,不让 LLM 猜测结构化字段

6.4 插件与可视化

  • MLOps 插件:校准、集成、训练任务、promote/rollback
  • 反馈同步插件(可选):ingest 至训练侧
  • Dashboard:反馈洞察(差评率趋势、偏差方向分布、校准记录、训练/回测/灰度状态)

七、决策规则与门禁

7.1 快环规则示例

1
2
3
4
5
6
7
8
9
10
11
fast_loop:
  calibration:
    enabled: true
    slice_by: [region, product, tier, model_version]
    min_feedback_count: 10
    window_days: 7
    poor_rate_threshold: 0.20
    high_bias_ratio_threshold: 0.70
    delta_formula: "-median(estimated_bias)"
    max_abs_offset: 200
    default_expiry_days: 14

7.2 慢环规则示例

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
slow_loop:
  retrain_proposal:
    enabled: true
    min_feedback_count: 30
    window_days: 7
    poor_rate_threshold: 0.25
  backtest_gate:
    error_improvement_min: -0.10
    strategy_drift_max: 0.05
    compliance_violations_max: 0
  canary:
    initial_traffic_percent: 30
    monitor_hours: 48
    poor_rate_regression_threshold: 0.05
    auto_rollback: true

7.3 三叉门禁

自动 promote 须同时满足:回测通过、核心指标改善、策略偏移与合规在阈值内。否则拒绝上线,保留快环,生成运维报告,可选人工确认。


八、分阶段实施

阶段内容业务价值依赖
P0场景模板 + 表单 + 落库;全链路 ID 关联可观测、可积累平台
P1反馈看板;聚合报告;enrich业务与数据科学对齐平台
P2决策定时流;快环校准 API 联调数天内可感知改善校准 API
P3慢环训练 + 回测门禁 + 灰度模型层自进化训练/回测 API
P4feedback ingest 入训;集成自动调权更完整的慢环流水线成熟

建议首期上线 P0~P2,慢环与试运行并行。


九、风险与应对

风险应对
少量情绪化差评导致误校准最小样本量;滑动窗口;校准上限与过期
LLM 解析错误仅 enrich;表单字段为准;低置信度不入决策
快环与慢环冲突新模型上线后逐步减弱或撤销对应 offset
业务不愿填表「好」一键;「差」才展开;预填上下文
MLOps API 未就绪P0/P1 先积累;Mock 校准;并联定义 OpenAPI
自动上线引发业务风险三叉门禁 + 灰度 + 自动 rollback;异常人工确认
反馈与真实结果偏差大博弈类模板收集真实结果;慢环样本加权

不推荐做法

  • LLM 直接决定超参或生产上线
  • 无版本、无回滚的「自进化」
  • 每条差评立即触发重训
  • 平台方越界自建完整训练流水线(与职责边界冲突)

十、小结

要点结论
建设边界平台:反馈层 + 决策编排 + MLOps 插件;业务侧 ML:训练 / 发布 / 校准 API
数据基础场景化反馈模板;结构化可统计;自由文本仅作 LLM 补充
双环快环(校准/路由)数天内见效;慢环(重训+回测+灰度)提升底层模型
角色分工统计决策用代码、执行用 API、解释用 LLM;预测数值禁止臆造
「零技术人员」指零手工调参、零写代码;保留回测强制与异常人工确认

附录 A:Schema 草案

A.1 TPL_VALUE_RECOMMEND(节选)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
{
  "$id": "TPL_VALUE_RECOMMEND",
  "version": "1.0",
  "type": "object",
  "required": ["rating"],
  "properties": {
    "rating": { "enum": ["good", "fair", "poor"] },
    "main_issues": {
      "type": "array",
      "items": {
        "enum": [
          "too_high", "too_low", "volatility",
          "inconsistent_with_recent", "mismatch_customer",
          "external_ref_wrong", "unclear"
        ]
      }
    },
    "bias_direction": { "enum": ["high", "low", "reasonable"] },
    "bias_magnitude": { "enum": ["lt_30", "30_80", "80_150", "gt_150"] },
    "expected_range": {
      "type": "array", "items": { "type": "number" }, "minItems": 2, "maxItems": 2
    },
    "free_text": { "type": "string", "maxLength": 200 }
  }
}

A.2 反馈记录统一结构(存储)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
{
  "feedback_id": "string",
  "request_id": "string",
  "session_id": "string",
  "user_id": "string",
  "timestamp": "date-time",
  "template_id": "string",
  "template_version": "string",
  "rating": "string",
  "structured": "object",
  "free_text": "string",
  "llm_enriched": "object",
  "prediction_context": {
    "region": "string",
    "product": "string",
    "tier": "string",
    "recommended": "number",
    "model_version": "string",
    "feature_snapshot_id": "string"
  }
}
本文由作者按照 CC BY 4.0 进行授权