文章

Leiden社区检测应用案例 信也杯欺诈用户风险识别

Leiden社区检测应用案例 信也杯欺诈用户风险识别

– title: Leiden社区检测应用案例-信也杯欺诈用户风险识别 date: 2026-08-10 11:30:00 categories: [AI, ML] tags: [AI, ML, 聚类, Leiden] image: path: /assets/img/posts/common/ml.jpg —

Leiden 社区检测应用案例-信也杯欺诈用户风险识别

本文整理 DGraph-Fin(信也科技集团,NeurIPS 2022 Datasets & Benchmarks)与 第七届信也科技杯「欺诈用户风险识别」 公开方案中的图反欺诈要点:三分类背景节点、每人一个风险分数、图特征拼进表格模型。竞赛 Top 方案以 GraphSAGE + LightGBM 为主;其「多数人不强制给判定、背景节点仍进图」的设计,与图社区 / 团伙检测落地时「敢于输出无结论」高度同构。

最重要的设计决定是:绝大多数人应该没有社群结论。系统要敢于输出「此人无可判定关系」,而不是硬塞进某个群。这一点反直觉,但它决定了整套东西是可信还是虚假繁荣。

参考与延伸阅读


目录


1. 案例定位

项目内容
数据集DGraph-Fin:真实金融社交网络,用于图异常检测
竞赛信也科技杯 欺诈用户风险识别
节点互联网信贷用户
有向边 A→B 表示 A 将 B 登记为紧急联系人(主观申报关系)
任务本质「此人有多可疑」,而非「此人属于哪个团伙」

核心结论(来自 DGraph 数据集设计本身):

「不给结论」不是工程妥协,而是主流方案在数据集设计层面就承认的一等公民概念——DGraph 明确把约 66.8% 的用户标记为「背景节点」:进图、参与特征计算,但不作为检测目标、不要求给出判定

由此得到设计准则:「无结论」必须是一种显式的输出状态,而不是流程的失败分支。


2. DGraph-Fin 基础事实

项目内容
规模3,700,550 节点 / 4,300,999 边
节点语义互联网信贷用户
边语义有向边 A→B:A 将 B 登记为紧急联系人
边类型0–11 共 12 类(紧急联系人分类)
边属性时间戳(脱敏为从 1 起的正整数,单位天,范围 1–821)→ 异构动态图
节点属性17 维脱敏向量,缺失值填 -1

节点三分类:

类别定义数量占比
欺诈用户(正样本)过去借贷行为中出现逾期且欺诈15,5090.42%
正常用户(负样本)从未逾期或欺诈1,210,09232.7%
背景节点无借贷行为、未标注、不作为欺诈检测目标,仅用于补充社交网络连通性与邻域背景信息2,474,94966.8%

有借款记录(即可标注)的节点合计 1,225,601,约占 32.2%。欺诈仅 0.42%——「大部分是正常人」是这类问题的默认前提。


3. 机制一:三分类,不是二分类(背景节点)

3.1 定义与意图

DGraph 论文对背景节点(Background Node, BN)的定义大意如下:

这些节点是注册用户但尚未从平台借款。由于缺乏借贷行为,这些节点不是异常检测的目标。尽管如此,它们在图的连通性中起着至关重要的作用,并且可以帮助更好地识别异常节点。因此被保留并标记为背景节点。

论文并把概念一般化:需要分类预测的节点称为目标节点(target nodes),其余称为背景节点。 并举例 MAG240M——上亿篇论文中只有约两百万篇 Arxiv 论文参与分类,其余不是任务目标,但因维持网络连通性与携带语义信息而必须保留。

要点:目标人群与背景人群分离;背景人群进图但不给判定。

3.2 反直觉发现:背景节点携带判别力

论文进一步测量了背景节点的作用:

  • 异常节点的入邻居中约 46.0% 是背景节点,出邻居中约 31.1%
  • 正常用户则相反——入邻居中背景节点比例更低,出邻居中比例更高;
  • 在 2 跳关系上,以背景节点为中间节点的连接,同配性比率高于其他关系
  • 2 跳连接的同配性比率大于两个直接相连节点的同配性比率

三条推论:

  1. 不能因为「给不出结论」就把这些人剔除出图——他们的存在方式本身就是信号。
  2. 「与背景人群的连接模式」可作为特征——异常者与正常者在该维度上表现不同。
  3. 2 跳关系可能比 1 跳更有判别力,值得在特征工程中显式加入二跳统计量。

4. 机制二:输出每人一个分数,不是每人一个群

维度信也杯 / 欺诈风险识别
问题形式「此人有多可疑」
输出每人一个连续风险分数
正常人如何处理分数低即可,不需要被塞进某个群
图里正常人 / 背景节点的作用提供对比基线与邻域上下文

因为输出是分数而不是强制群归属,「大部分人是正常人 / 背景节点」就不构成产品矛盾——他们自然落在低分区或不作为检测目标。若输出被定义为「每人必须有群归属」,系统就会对每个人硬塞结论,即使毫无信息量。


5. Top 方案特征构成

以第七届信也科技杯一例高分方案为例(初赛 AUC 约 0.83631):三步为 GraphSAGE 节点 embedding → 手工补时序等特征 → LightGBM 分类

最终每节点约 201 维特征向量,由以下直接拼接:

特征块维度说明
图 embedding64GraphSAGE
节点自身特征17原始脱敏属性
邻居节点类别数量8多类节点 × 出边/入边分开统计
边类别数量22多类边 × 出边/入边分开统计
时序边数量90时序均分 45 桶 × 出边/入边分开统计

要点:

  • 通行范式是「图 → 图特征 → 拼进表格特征 → 有监督树模型」,社群 ID / embedding 只是其中一块特征,不是终点。
  • 时序切桶(约 90 维)占比高:按时间桶统计边频次,刻画关系活跃节律。
  • 类别极度不平衡时,树模型侧常用 scale_pos_weight 等补偿;主指标宜关注 PR-AUC / AUC,而非 accuracy。

6. 竞赛版完整流程

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
阶段一 · 建图(全量入图,不预先筛掉背景节点)
  原始用户与紧急联系人关系
      ↓
  人—关系 有向图(可再按需投影 / 异构处理)
      ↓
阶段二 · 节点定性(关键:三分类)
  目标·正样本(已知欺诈 ~0.42%)
  目标·负样本(已知正常 ~32.7%)
  背景节点(~66.8%,不作检测目标,只提供连通与邻域上下文)
      ↓
阶段三 · 图特征
  GraphSAGE / 邻域统计 / 时序桶 …
  (社群 ID、规模、中心性等亦可作为可选图特征列)
      ↓
阶段四 · 打分,而非强制分群
  拼接:图特征 + 原始字段 + 时序桶
      ↓
  LightGBM 等有监督模型
      ↓
  每人一个风险分数(主指标如 AUC / PR-AUC)

九个步骤要点(通用图反欺诈流水线,与信也杯设定对齐):

步骤动作关键要点
1关系 / 实体抽取DGraph 边为紧急联系人登记;同类竞赛亦常见卡、设备等共享实体
2建图保留全量节点(含背景节点),勿因「暂不打分」而删边删点
3hub 治理建完先看度数分布;超级节点需剔除或降权,否则结构特征易失效
4节点三分类把「不作为检测目标」显式建模为背景节点
5图特征计算embedding、邻域计数、时序桶;结构类特征训练时注意不泄漏标签
6特征拼接图特征与原始表格特征并列(示例中 embedding 64 维 / 合计约 201 维)
7有监督模型LightGBM 等;注意类别不平衡与时间切分验证
8输出分数每人一个连续分,不是硬标签、不是强制群归属
9收窄与回流(可选)若有已知坏样本,可按社群内浓度排序做人工核查,结果回流为新标签

边语义提醒:DGraph 的边是主观申报的有意关系(登记紧急联系人),强度通常高于偶然共现;换到弱共现场景时,建边与去噪要求会更高。


7. 小结

要点结论
不平衡欺诈约 0.42%,「多数正常」是默认前提
背景节点66.8% 进图、参与连通与特征,不作检测目标
背景节点价值异常者邻域中背景占比高;2 跳同配性可高于 1 跳,不可随意剔除
输出形态每人一个风险分数,而非强制每人一个社群 ID
Top 方案骨架GraphSAGE embedding + 邻域/边类型/时序桶 + LightGBM
设计准则「无结论」是一等公民状态;硬塞群归属易导致虚假繁荣

8. 参考与来源

资源说明
DGraph-Fin 数据集(ScienceDB, DOI 10.57760/sciencedb.09602)三类节点定义与占比
DGraph: A Large-Scale Financial Dataset for Graph Anomaly Detection,NeurIPS 2022(arXiv:2207.03579背景节点定义、作用与同配性实测
torch_geometric.datasets.DGraphFin图规模、边类型 0–11、时间戳 1–821
第七届信也科技杯方案示例(GitHub约 201 维特征、时序 45 桶、LightGBM

文中规模与占比等数字均来自上述公开来源。

本文由作者按照 CC BY 4.0 进行授权