Research Presentation · 2026

属性图聚类研究 从对比学习到基础模型

Attributed Graph Clustering: From Contrastive Learning to Foundation Models

刘云辉 Yunhui Liu
刘云辉 · Yunhui Liu
南京大学 · 软件工程直博三年级
计算机软件新技术国家重点实验室 · Ph.D. Student, NJU
  • 导师 · 何铁科教授、赵建华教授
  • 实习 · 蚂蚁集团研究实习,Mentor 刘永超博士
  • 方向 · 图机器学习(聚类、异常检测、高效推理)、知识增强大模型
Attributed Graph Clustering Graph Foundation Model Graph Anomaly Detection LLM-Graph Synergy
10+ 学术论文
KDD · ICLR · WWW 顶级会议 / 期刊
3.1M+ HF 模型下载
111M+ 节点规模支持
About

个人简介

🎓 教育背景

南京大学 · 直博研究生
软件工程 · 2024.09 – 至今(3年级)
导师:何铁科教授、赵建华教授
南京大学 · 本科
软件工程 · 2020.09 – 2024.06

💼 实习经历

蚂蚁集团 · 研究实习生
2025.07 – 2026.02 · 杭州
图/表格数据学习 · GraphRAG · 先享后付风控
Mentor: 刘永超博士

🏆 荣誉奖项

  • 国家奖学金,2025
  • 江苏省研究生创新计划,2026
  • Insta360 Think Bold 特等奖学金,2026

🔬 研究方向

  • 图结构数据学习:图聚类、图异常检测、链接预测
  • 基础模型:图基础模型、表格基础模型
  • 大语言模型:LLM + 知识图谱、文本图
  • 工业应用:欺诈检测、用户分群、GraphRAG

📦 开源项目

属性图聚类统一框架 · 20+ 算法 · 111M 节点支持 · PyPI 开源
HuggingFace 情感分析模型 · 3,108,129+ 下载
异构文本属性图数据集 · WWW 2025

✍️ 学术服务

Reviewer: NeurIPS 2026, KDD 2025/26/27, ICANN
期刊审稿: PR, TKDE
助教: 大数据分析 (2024), 数据管理基础 (2025)
基础知识

什么是图(Graph)?

图的数学定义

$\mathcal{G} = (\mathcal{V}, \mathcal{E}, X)$

$\mathcal{V}$:节点集合(实体),$|\mathcal{V}| = N$
$\mathcal{E} \subseteq \mathcal{V} \times \mathcal{V}$:边集合(关系)
$X \in \mathbb{R}^{N \times F}$:节点特征矩阵
$A \in \{0,1\}^{N \times N}$:邻接矩阵
拓扑结构
节点间连接关系(邻接矩阵 $A$)
节点属性
每个节点的特征向量(特征矩阵 $X$)

🌍 现实世界中的图

🧑‍🤝‍🧑
社交网络
节点=用户, 边=关注
🛒
电商图
节点=用户/商品, 边=购买
📚
引用网络
节点=论文, 边=引用
🧬
分子图
节点=原子, 边=化学键
为什么需要图神经网络(GNN)?
传统深度学习处理序列或网格数据(文本/图像),
而图具有不规则拓扑结构。GNN 通过消息传递聚合邻居信息, 在图上学习节点表示:
$h_v^{(l+1)} = \text{UPDATE}\!\left(h_v^{(l)},\; \text{AGG}\!\left(\{h_u^{(l)} : u \in \mathcal{N}(v)\}\right)\right)$
交互示例:真实图结构(拖拽节点)
引文网络示意 · 节点 = 论文 · 有向边 = 引用
|V| = 16 |E| = 28
核心任务

什么是图聚类(Graph Clustering)?

任务定义

将图中的节点划分为若干语义相似的组(簇), 同时利用节点属性拓扑结构, 且无需标签监督
给定 $\mathcal{G}=(A, X)$,找到分配函数:
$f: \mathcal{V} \to \{1, 2, \ldots, K\}$
使同簇节点相似度高,跨簇节点相似度低

📊 评估指标

NMI
归一化互信息
ACC
聚类准确率
ARI
调整兰德指数
F1
F1 分数
可视化:图聚类把节点分成颜色各异的簇
簇内连接紧密 · 簇间连接稀疏 · 无监督划分
K = 4

🌐 应用场景

  • 社区发现:社交网络用户群组
  • 欺诈检测:异常子图识别
  • 用户分群:电商个性化推荐
  • 知识整合:实体关系挖掘

⚠️ 主要挑战

  • 无监督:无标签指导
  • 属性-结构冲突:图同配性/异配性
  • 可扩展性:百万级节点
  • 模型选择:无验证集调参

📈 研究现状

  • GNN + 对比学习(如 NS4GC)
  • 图自编码器(如 DAEGC)
  • 谱聚类方法(如 SASE)
  • 基础模型(OFAG)← 我们的工作
Papers

研究成果总览

图聚类 · Graph Clustering
Under Review @ KDD 2027
Yunhui Liu, Xudong Jin, Kang Zhang, et al.
Foundation ModelZero-shot
arXiv 2026 (Survey)
Yunhui Liu, Yue Liu, Yongchao Liu, et al.
Survey
arXiv 2026 (Benchmark)
Yunhui Liu, Pengyu Qiu, Yu Xing, Yongchao Liu, et al.
Benchmark
TKDE 2024
Yunhui Liu, Xinyi Gao, Tieke He, et al.
Contrastive
CIKM 2024
Yunhui Liu, Tieke He, Qing Wu, et al.
Scalable
Under Review @ NeurIPS 2026
Yunhui Liu, Xudong Jin, Qizhuo Xie, et al.
HierarchicalLLM+GNN
图异常检测 · Graph Anomaly Detection
WWW 2026
Yunhui Liu, Tieke He, Yongchao Liu, et al.
其他方向
Journey

图聚类研究路线

1
对比学习
NS4GC · TKDE 2024
节点相似度矩阵引导的对比图聚类
2
可扩展性
SASE · CIKM 2024
线性复杂度谱嵌入,支持大规模图
3
层次聚类
SHiFT · UR @ NeurIPS 2026
LLM+GNN 协同挖掘语义层次结构
4
工业基准
PyAGC · arXiv 2026
20+ 算法统一框架,工业图测试
5
基础模型 ⭐
OFAG · UR @ KDD 2027
单一模型,零样本聚类任意图
核心洞察(从研究积累到的关键发现):
现有方法存在根本局限——每张新图都需要重新训练、调参,
在无标签的非监督聚类任务中,甚至没有验证集来指导模型选择。
能否训练一个通用模型,直接应用于任意属性图? → OFAG

NS4GC 核心思想

节点相似度矩阵视角的对比学习:理想矩阵 = 增强邻接矩阵(保留簇内高相似边)。 8 个数据集上最佳均值 & 平均排名。

SASE 核心思想

无参数谱嵌入:$k$ 阶图卷积 + 随机傅里叶特征 + 自适应阶数。 线性复杂度,ArXiv ACC +6.9%, 5.87× 加速。

SHiFT 核心思想

EM 框架协同 LLM(分类专家)与 GNN:E 步归纳语义树,M 步对齐层次结构。 输出层次感知embedding与人类可读taxonomy。

PyAGC 核心贡献

Encode–Cluster–Optimize 统一框架,首次 mini-batch 实现, 2.7K–111M 节点,工业图测试。蚂蚁集团实战验证。
OFAG

动机:现有方法的根本局限

⚠️ "一图一模型"范式的痛点

💸
高昂计算代价
每张新图都需从头训练 + 调参
🎯
无标签验证集
无监督聚类无法做超参选择
📐
特征空间不兼容
不同图特征维度/语义各异

三大核心挑战

(i) 簇标签排列可变性
$K$ 在不同图上变化,且簇身份无跨图一致含义,无法使用共享输出头
(ii) 推理时无监督信号
测试时无标签、无验证集、无 few-shot 上下文,无法做域适应
(iii) 无监督特征空间对齐
有监督 GFM 通过标签微调解决,聚类无法利用下游监督
我们的问题:
能否训练一个冻结的单一模型,在无图特定训练、
微调或超参搜索的情况下,直接用于任意属性图聚类?

已有 GFM 方案的局限

  • 文本空间 GFM(OFA, GraphGPT):需要文本节点属性 + 数据集特定模板
  • 特征对齐 GFM(GCOPE, UniGraph):需要目标图微调
  • 完全归纳 GFM(GraphAny, NodePFN):需要推理时有标签上下文集——聚类无法提供

OFAG 的核心思路

借鉴 Prior-data Fitted Networks(PFN) 范式, 在合成图上学习可复用的聚类推理策略, 推理时一次前向传播直接产生簇友好嵌入。
Pre-train once on $p(\mathcal{D})$ → Freeze → Apply anywhere
OFAG

OFAG 整体框架

OFAG = One-for-All Foundation Model for Attributed Graph Clustering  ·  Paper  ·  Code
📦
CAGM Prior
合成属性图生成器
覆盖多样化图结构
🔄
SwiFRT Encoder
维度无关图编码器
每特征通道独立处理
🎯
Hyperspherical Obj.
超球面聚类目标
vMF 分布驱动
Zero-Shot Inference
单次前向传播
+ K-Means 聚类

训练阶段(Pre-training)

在合成属性图 $(A,X,y) \sim p(\mathcal{D})$ 上优化:
$\theta^* = \arg\min_\theta\; \mathbb{E}_{(A,X,y)\sim p(\mathcal{D})}\bigl[\mathcal{L}\bigl(y,\, f_\theta(A,X)\bigr)\bigr]$
$y$ 是合成标签(仅训练时可见)。学习可复用的表示几何,而非数据集特定解。

推理阶段(Zero-shot Inference)

$Z = \operatorname{SwiFRT}_{\theta^*}(X, A)$
$z_i = Z_{i,:}/\|Z_{i,:}\|_2$
→ $k\text{-means}(Z)$
所有参数冻结,无需梯度更新、图特定训练或验证标签

与 PFN 的关系(理论依据)

Prior-data Fitted Networks 通过在先验分布采样的合成数据上学习, 摊还贝叶斯推断——无需测试时更新参数。
最小化 $\mathbb{E}[\mathcal{L}_\text{comp}]$ ≡ 最小化空上下文 vMF 混合 PFN 的
Prior-Data Negative Log-Likelihood
学习的目标:表示几何
同簇节点靠近同一原型 · 原型在超球面上均匀分布
OFAG

CAGM:合成属性图先验

核心思想:One-for-all 的泛化能力完全依赖先验 $p(\mathcal{D})$ 的广度。 过于狭窄的先验会导致模型学习到在分布外图上失效的捷径。 CAGM 是一个潜变量生成模型,以簇成员关系作为节点属性和图结构的共同原因。

生成过程(Generative Structure)

采样规模:$N, F, K$ 从宽分布采样;
簇比例 $\pi \sim \text{Dirichlet}(\eta \mathbf{1}_K)$(含严重不平衡情形)
节点属性生成
$h_i^X \mid y_i=k \sim t_\nu(\mu_k, \Sigma_k)$(簇条件潜变量)
→ 随机变换 $T$ 解码为连续/类别/计数/词袋特征
边生成
$A_{ij} \sim \text{Bernoulli}(\sigma(s_{ij}))$
$s_{ij} = \rho + \alpha(\theta_i+\theta_j) + \lambda_B B_{y_i,y_j} + \lambda_H\kappa(h_i^A,h_j^A) + \lambda_X\text{sim}(x_i,x_j)$
同配性控制
$h \sim \text{Uniform}(0.1, 0.9)$,平滑插值同配→异配图结构

设计理念

  • 若只生成同配图 → 模型退化为特征平滑启发式
  • 若属性总是可分 → 模型忽略拓扑信息
  • 独立随机化属性可分性、边-簇耦合、结构模式
    迫使模型学习自适应策略,按可靠性加权属性与结构证据

定理:合成→真实泛化保证

定理(Synthetic-to-Real Generalization):
设 $p_\text{real}(\mathcal{G})$ 满足:
(i) 条件特征分布 $p(X|y)$ 是连续分布的有限混合;
(ii) 边分布 $p(A|y,X)$ 遵循配对概率模型。

则存在图编码器 $\Phi$ 和 CAGM 先验 $p_\text{syn}$,使得 $\Phi_\# p_\text{syn}(\mathcal{G})$ 以任意小总变差距离逼近 $p_\text{real}(\mathcal{G})$。
CAGM 生成的图多样性示意
低/中:交错排列看连边;高同配性:同簇节点聚在一起
OFAG

SwiFRT:维度无关图编码器

核心问题:维度特定的特征变换 $XW$($W \in \mathbb{R}^{F \times d}$) 绑定于固定特征维度 $F$,无法零样本迁移到不同图上。
SwiFRT 把每个特征通道 $X_{:,f}$ 视为图上的标量信号, 编码其在图滤波器组下的结构响应,而非原始特征值。

Step 1:滤波器响应轮廓

设 $\hat{A} = \tilde{D}^{-1/2}(A+I)\tilde{D}^{-1/2}$ 为对称归一化邻接矩阵, 对节点 $i$ 和特征通道 $f$,收集各扩散阶次的信号值:
$r_{i,f} = \bigl[(\hat{A}^0 X)_{i,f},\; (\hat{A}^1 X)_{i,f},\; \ldots,\; (\hat{A}^L X)_{i,f}\bigr] \in \mathbb{R}^{L+1}$
该轮廓刻画信号是否局部稳定、被邻居平滑、或跨多跳放大/衰减—— 独立于语义内容,跨图可迁移。

Step 2:Transformer 编码

将每阶次响应嵌入为 $d$ 维 token:
$e_{i,f,\ell} = \phi_\text{val}(r_{i,f,\ell}) + p_\ell$
$h_{i,f} = \text{Transformer}([c_\text{cls}, e_{i,f,0}, \ldots, e_{i,f,L}])_{[0]}$
$Z_{i,f} = \phi_\text{out}(h_{i,f})$
Transformer 仅在同一 $(i,f)$ 对的滤波器阶次 token 间做自注意力, 学习不同扩散阶次间的交互模式。

Step 3:节点嵌入

$z_i = Z_{i,:} / \|Z_{i,:}\|_2 \in S^{F-1}$
SwiFRT 信号响应示意
同一节点 $i$,三个特征通道 $f$ 的滤波器轮廓 $r_{i,f}\in\mathbb{R}^{L+1}$

命题:维度无关性 & 特征置换等变性

设 $\sigma$ 为特征索引的任意置换,$X_\sigma$ 为对应置换后的特征矩阵。SwiFRT 满足:

(i) 维度无关:可训练参数数量与输入特征维度 $F$ 无关;
(ii) 置换等变:$\operatorname{SwiFRT}(X_\sigma, A) = \operatorname{SwiFRT}(X, A)_\sigma$

为什么结构响应具有可迁移性?

  • 均匀平滑扩散的信号 ≠ 局部振荡的信号——无关语义内容
  • 同一响应模式在不同图(甚至不同域)中具有相似的聚类意义
  • 通道独立处理 → 任意 $F$ 均可共享同一组参数
OFAG

超球面聚类目标函数

原型计算(Episode-specific Prototypes)

对每个合成图,用当前嵌入动态计算簇原型,支持可变 $K$:
$\hat{\mu}_k = \dfrac{\sum_{i:\,y_i=k} z_i}{\bigl\|\sum_{i:\,y_i=k} z_i\bigr\|_2 + \varepsilon} \in S^{F-1}$
按轮次动态计算,无全局原型参数,无固定簇身份结构。

紧凑性损失 $\mathcal{L}_\text{comp}$(vMF MLE)

$q_\theta(y_i{=}k \mid z_i) = \dfrac{\exp(\hat{\mu}_k^\top z_i/\tau)}{\sum_{k'} \exp(\hat{\mu}_{k'}^\top z_i/\tau)}$

$\mathcal{L}_\text{comp} = -\dfrac{1}{N}\sum_{i=1}^N \log\dfrac{\exp(\hat{\mu}_{y_i}^\top z_i/\tau)}{\sum_{k=1}^K \exp(\hat{\mu}_k^\top z_i/\tau)}$
拉近节点表示与其簇原型,推远与其他原型的距离。 等价于以 $\kappa=1/\tau$ 为集中度的 $K$ 分量 vMF 混合模型的 MLE。

分散性损失 $\mathcal{L}_\text{disp}$

$\mathcal{L}_\text{disp} = \dfrac{1}{K}\sum_{k=1}^K \log\dfrac{1}{K-1}\sum_{j\neq k} \exp\!\bigl(\hat{\mu}_k^\top\hat{\mu}_j/\tau\bigr)$
最小化不同原型间的余弦相似度,使原型均匀分布在超球面上。 最优解趋向等角紧框架(ETF)——最大化簇间角度分离。
超球面上的聚类几何
节点聚集于原型 $\mathcal{L}_\text{comp}$ · 原型均匀分散 $\mathcal{L}_\text{disp}$

总体训练目标

$\mathcal{L}(\theta) = \mathbb{E}_{(A,X,y)\sim p(\mathcal{D})}\bigl[\mathcal{L}_\text{comp} + \lambda\,\mathcal{L}_\text{disp}\bigr]$
Monte Carlo 近似:每步采样一批合成图 → 编码 → 计算即时原型 → 反传

互补性分析

$\mathcal{L}_\text{comp}$
节点聚集于其簇原型,远离其他簇原型(簇内紧凑)
$\mathcal{L}_\text{disp}$
原型均匀铺展于超球面(簇间分离)
实验结果

OFAG 性能:质量 & 效率双领先

1st
平均排名 (Avg. Rank)
NMI/ACC/ARI/F1
39.49
平均 NMI(10数据集)
最高均值
12.43min
10 个数据集总运行时间
最快方法
28×
比聚类质量第二快的方法
时间加速比
表:NMI (↑) 对比,数据集涵盖同配图与异配图(节选代表性方法)
方法 Cora Photo ArXiv Reddit Products HM (异配) Flickr (异配) MAG Mean Avg.Rank
KMeans13.8931.7022.5911.0829.2410.171.2128.3215.2116.30
S3GC55.4568.2747.1183.4553.4311.577.8439.8038.085.10
MAGI58.9468.6546.5372.5344.5811.246.3141.3436.825.75
NS4GC59.4072.6248.3956.7154.6315.286.1941.6437.213.40
OFAG ⭐ 57.06 71.45 45.08 85.94 52.77 11.61 9.27 41.78 39.49 3.05

⚡ 效率对比(总运行时间)

💡 关键发现

  • 单个冻结模型在所有 10 个数据集上达到最佳均值性能和平均排名
  • OFAG 完成全部 10 个数据集仅 12.43 分钟,第二快方法需 76 分钟+
  • 考虑到现有方法在每张新图上还需盲目调参,实际时间节省达数量级
  • 预训练一次,永久冻结,对任何新图均可直接应用
实验结果

预训练为何重要:先验广度 + 训练动态

核心主张:One-for-all 的上限由先验 $p(\mathcal{D})$ 的覆盖决定;可迁移的聚类策略则在预训练中被迅速习得。 一次预训练覆盖 80,000 张合成图(10,000 steps,约 1.5 h / A800),随后永久冻结,以最低验证损失 checkpoint 做零样本推理。
先验消融:同配性覆盖 $h$
预训练时限制 $h$ 的采样区间 → 零样本 All NMI(10 图均值)

组件消融(All NMI / ACC)

变体 Homo Hetero All NMI Δ
OFAG(完整) 62.4616.51 39.49
仅连续特征 62.0216.1239.07 −0.42
仅同配图 $h\in[0.7,0.9]$ 61.4615.6538.56 −0.93
$g_\theta$: Transformer → MLP 60.2413.8037.02 −2.47
去掉 $\mathcal{L}_\text{disp}$ 61.4014.5037.95 −1.54
去掉 $\ell_2$ 归一化 54.7214.1034.41 −5.08
预训练动态:真实图上的 checkpoint NMI
实测 checkpoint:init → step 50 → 每 500 steps;前 ~1,000 steps 陡升后进入平台期

滤波器阶数 $L$

SwiFRT 多尺度上下文;$L{=}2$ 明显不足
$L$23581012
All NMI 37.2238.7539.0638.91 39.49 39.16

分散权重 $\lambda$

$\lambda{=}0$ 最差;只要 $\lambda{>}0$ 即稳定
$\lambda$00.10.30.51.0
All NMI 37.95 39.49 38.8139.3839.28

先验必须够广

全谱 $h\in[0.1,0.9]$ 全面最优。只训同配会过平滑;只训异配会把信息赶到簇间,同配 NMI 掉 −10.84

策略学得很快

同配 51.0→62.7、异配 12.0→16.5、全部 31.5→39.6:前 50 steps 已大幅跃升,随后平台期低幅波动。

几何与目标同样关键

$\ell_2$ 归一化去掉后跌幅最大(All NMI −5.08);$\mathcal{L}_\text{disp}$ 对异配图尤其重要(Hetero NMI $+2.01$)。
总结

总结与未来展望

📌 研究贡献总结

  • NS4GC(TKDE 2024):节点相似度矩阵视角的对比图聚类,SOTA
  • SASE(CIKM 2024):线性复杂度无参数谱嵌入图聚类
  • SHiFT(arXiv 2026):LLM+GNN 协同层次聚类,EM 范式
  • PyAGC(arXiv 2026):工业级属性图聚类基准与统一框架
  • OFAG(KDD 2027):首个属性图聚类基础模型,零样本迁移
  • Survey(arXiv 2026):系统综述,Encode-Cluster-Optimize 分类框架

🔬 OFAG 的核心创新

  • CAGM 先验:耦合属性图生成,覆盖多样图结构
  • SwiFRT 编码器:信号响应空间,维度无关零样本迁移
  • 超球面目标:vMF 混合 MLE,ETF 最优原型几何
  • 理论保证:PFN 框架、合成→真实泛化定理

🚀 未来研究方向

  • 自动 $K$ 选择:无需先验知识的簇数量估计
  • 更大规模训练:十亿节点级合成图预训练
  • 层次聚类:结合 Taxonomy 的分层语义
  • 异常感知聚类:整合异常检测(APF, TFM4GAD)
  • 大语言模型增强:文本属性图的语义先验注入

💼 工业应用潜力

  • 零样本用户分群:无需每次重新训练
  • 欺诈团伙发现:异配图聚类(异配性鲁棒)
  • GraphRAG:图结构社区挖掘辅助 RAG
  • 已在蚂蚁集团先享后付风控场景实践验证
核心主张:图聚类的"预训练一次,随处应用"范式 不仅在概念上令人信服,而且在实践中同时实现了最高精度和最快速度
刘云辉 · Yunhui Liu
Ph.D. Student · Nanjing University
📧 lyhcloudy1225@gmail.com 🌐 cloudy1225.github.io 🐙 github.com/Cloudy1225
← → 方向键 / 点击导航