Leiden社区检测应用案例 信也杯欺诈用户风险识别
– title: Leiden社区检测应用案例-信也杯欺诈用户风险识别 date: 2026-08-10 11:30:00 categories: [AI, ML] tags: [AI, ML, 聚类, Leiden] image: path: /assets/img/posts/common/ml.jpg —
Leiden 社区检测应用案例-信也杯欺诈用户风险识别
本文整理 DGraph-Fin(信也科技集团,NeurIPS 2022 Datasets & Benchmarks)与 第七届信也科技杯「欺诈用户风险识别」 公开方案中的图反欺诈要点:三分类背景节点、每人一个风险分数、图特征拼进表格模型。竞赛 Top 方案以 GraphSAGE + LightGBM 为主;其「多数人不强制给判定、背景节点仍进图」的设计,与图社区 / 团伙检测落地时「敢于输出无结论」高度同构。
最重要的设计决定是:绝大多数人应该没有社群结论。系统要敢于输出「此人无可判定关系」,而不是硬塞进某个群。这一点反直觉,但它决定了整套东西是可信还是虚假繁荣。
参考与延伸阅读:
- DGraph 论文(arXiv):https://arxiv.org/abs/2207.03579
torch_geometric.datasets.DGraphFin- 第七届信也科技杯方案示例:https://github.com/RobertAckleyKid/2022_finvcup_RobertAckley_8363
目录
- 1. 案例定位
- 2. DGraph-Fin 基础事实
- 3. 机制一:三分类,不是二分类(背景节点)
- 4. 机制二:输出每人一个分数,不是每人一个群
- 5. Top 方案特征构成
- 6. 竞赛版完整流程
- 7. 小结
- 8. 参考与来源
1. 案例定位
| 项目 | 内容 |
|---|---|
| 数据集 | DGraph-Fin:真实金融社交网络,用于图异常检测 |
| 竞赛 | 信也科技杯 欺诈用户风险识别 |
| 节点 | 互联网信贷用户 |
| 边 | 有向边 A→B 表示 A 将 B 登记为紧急联系人(主观申报关系) |
| 任务本质 | 「此人有多可疑」,而非「此人属于哪个团伙」 |
核心结论(来自 DGraph 数据集设计本身):
「不给结论」不是工程妥协,而是主流方案在数据集设计层面就承认的一等公民概念——DGraph 明确把约 66.8% 的用户标记为「背景节点」:进图、参与特征计算,但不作为检测目标、不要求给出判定。
由此得到设计准则:「无结论」必须是一种显式的输出状态,而不是流程的失败分支。
2. DGraph-Fin 基础事实
| 项目 | 内容 |
|---|---|
| 规模 | 3,700,550 节点 / 4,300,999 边 |
| 节点语义 | 互联网信贷用户 |
| 边语义 | 有向边 A→B:A 将 B 登记为紧急联系人 |
| 边类型 | 0–11 共 12 类(紧急联系人分类) |
| 边属性 | 时间戳(脱敏为从 1 起的正整数,单位天,范围 1–821)→ 异构动态图 |
| 节点属性 | 17 维脱敏向量,缺失值填 -1 |
节点三分类:
| 类别 | 定义 | 数量 | 占比 |
|---|---|---|---|
| 欺诈用户(正样本) | 过去借贷行为中出现逾期且欺诈 | 15,509 | 0.42% |
| 正常用户(负样本) | 从未逾期或欺诈 | 1,210,092 | 32.7% |
| 背景节点 | 无借贷行为、未标注、不作为欺诈检测目标,仅用于补充社交网络连通性与邻域背景信息 | 2,474,949 | 66.8% |
有借款记录(即可标注)的节点合计 1,225,601,约占 32.2%。欺诈仅 0.42%——「大部分是正常人」是这类问题的默认前提。
3. 机制一:三分类,不是二分类(背景节点)
3.1 定义与意图
DGraph 论文对背景节点(Background Node, BN)的定义大意如下:
这些节点是注册用户但尚未从平台借款。由于缺乏借贷行为,这些节点不是异常检测的目标。尽管如此,它们在图的连通性中起着至关重要的作用,并且可以帮助更好地识别异常节点。因此被保留并标记为背景节点。
论文并把概念一般化:需要分类预测的节点称为目标节点(target nodes),其余称为背景节点。 并举例 MAG240M——上亿篇论文中只有约两百万篇 Arxiv 论文参与分类,其余不是任务目标,但因维持网络连通性与携带语义信息而必须保留。
要点:目标人群与背景人群分离;背景人群进图但不给判定。
3.2 反直觉发现:背景节点携带判别力
论文进一步测量了背景节点的作用:
- 异常节点的入邻居中约 46.0% 是背景节点,出邻居中约 31.1%;
- 正常用户则相反——入邻居中背景节点比例更低,出邻居中比例更高;
- 在 2 跳关系上,以背景节点为中间节点的连接,同配性比率高于其他关系;
- 且 2 跳连接的同配性比率大于两个直接相连节点的同配性比率。
三条推论:
- 不能因为「给不出结论」就把这些人剔除出图——他们的存在方式本身就是信号。
- 「与背景人群的连接模式」可作为特征——异常者与正常者在该维度上表现不同。
- 2 跳关系可能比 1 跳更有判别力,值得在特征工程中显式加入二跳统计量。
4. 机制二:输出每人一个分数,不是每人一个群
| 维度 | 信也杯 / 欺诈风险识别 |
|---|---|
| 问题形式 | 「此人有多可疑」 |
| 输出 | 每人一个连续风险分数 |
| 正常人如何处理 | 分数低即可,不需要被塞进某个群 |
| 图里正常人 / 背景节点的作用 | 提供对比基线与邻域上下文 |
因为输出是分数而不是强制群归属,「大部分人是正常人 / 背景节点」就不构成产品矛盾——他们自然落在低分区或不作为检测目标。若输出被定义为「每人必须有群归属」,系统就会对每个人硬塞结论,即使毫无信息量。
5. Top 方案特征构成
以第七届信也科技杯一例高分方案为例(初赛 AUC 约 0.83631):三步为 GraphSAGE 节点 embedding → 手工补时序等特征 → LightGBM 分类。
最终每节点约 201 维特征向量,由以下直接拼接:
| 特征块 | 维度 | 说明 |
|---|---|---|
| 图 embedding | 64 | GraphSAGE |
| 节点自身特征 | 17 | 原始脱敏属性 |
| 邻居节点类别数量 | 8 | 多类节点 × 出边/入边分开统计 |
| 边类别数量 | 22 | 多类边 × 出边/入边分开统计 |
| 时序边数量 | 90 | 时序均分 45 桶 × 出边/入边分开统计 |
要点:
- 通行范式是「图 → 图特征 → 拼进表格特征 → 有监督树模型」,社群 ID / embedding 只是其中一块特征,不是终点。
- 时序切桶(约 90 维)占比高:按时间桶统计边频次,刻画关系活跃节律。
- 类别极度不平衡时,树模型侧常用
scale_pos_weight等补偿;主指标宜关注 PR-AUC / AUC,而非 accuracy。
6. 竞赛版完整流程
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
阶段一 · 建图(全量入图,不预先筛掉背景节点)
原始用户与紧急联系人关系
↓
人—关系 有向图(可再按需投影 / 异构处理)
↓
阶段二 · 节点定性(关键:三分类)
目标·正样本(已知欺诈 ~0.42%)
目标·负样本(已知正常 ~32.7%)
背景节点(~66.8%,不作检测目标,只提供连通与邻域上下文)
↓
阶段三 · 图特征
GraphSAGE / 邻域统计 / 时序桶 …
(社群 ID、规模、中心性等亦可作为可选图特征列)
↓
阶段四 · 打分,而非强制分群
拼接:图特征 + 原始字段 + 时序桶
↓
LightGBM 等有监督模型
↓
每人一个风险分数(主指标如 AUC / PR-AUC)
九个步骤要点(通用图反欺诈流水线,与信也杯设定对齐):
| 步骤 | 动作 | 关键要点 |
|---|---|---|
| 1 | 关系 / 实体抽取 | DGraph 边为紧急联系人登记;同类竞赛亦常见卡、设备等共享实体 |
| 2 | 建图 | 保留全量节点(含背景节点),勿因「暂不打分」而删边删点 |
| 3 | hub 治理 | 建完先看度数分布;超级节点需剔除或降权,否则结构特征易失效 |
| 4 | 节点三分类 | 把「不作为检测目标」显式建模为背景节点 |
| 5 | 图特征计算 | embedding、邻域计数、时序桶;结构类特征训练时注意不泄漏标签 |
| 6 | 特征拼接 | 图特征与原始表格特征并列(示例中 embedding 64 维 / 合计约 201 维) |
| 7 | 有监督模型 | LightGBM 等;注意类别不平衡与时间切分验证 |
| 8 | 输出分数 | 每人一个连续分,不是硬标签、不是强制群归属 |
| 9 | 收窄与回流(可选) | 若有已知坏样本,可按社群内浓度排序做人工核查,结果回流为新标签 |
边语义提醒:DGraph 的边是主观申报的有意关系(登记紧急联系人),强度通常高于偶然共现;换到弱共现场景时,建边与去噪要求会更高。
7. 小结
| 要点 | 结论 |
|---|---|
| 不平衡 | 欺诈约 0.42%,「多数正常」是默认前提 |
| 背景节点 | 66.8% 进图、参与连通与特征,不作检测目标 |
| 背景节点价值 | 异常者邻域中背景占比高;2 跳同配性可高于 1 跳,不可随意剔除 |
| 输出形态 | 每人一个风险分数,而非强制每人一个社群 ID |
| Top 方案骨架 | GraphSAGE embedding + 邻域/边类型/时序桶 + LightGBM |
| 设计准则 | 「无结论」是一等公民状态;硬塞群归属易导致虚假繁荣 |
8. 参考与来源
| 资源 | 说明 |
|---|---|
| DGraph-Fin 数据集(ScienceDB, DOI 10.57760/sciencedb.09602) | 三类节点定义与占比 |
| DGraph: A Large-Scale Financial Dataset for Graph Anomaly Detection,NeurIPS 2022(arXiv:2207.03579) | 背景节点定义、作用与同配性实测 |
torch_geometric.datasets.DGraphFin | 图规模、边类型 0–11、时间戳 1–821 |
| 第七届信也科技杯方案示例(GitHub) | 约 201 维特征、时序 45 桶、LightGBM |
文中规模与占比等数字均来自上述公开来源。