相关文章推荐
风流的板栗  ·  香港閱讀城·  11 月前    · 
考研的台灯  ·  OH 3.3.0 Frontail not ...·  1 年前    · 
知识渊博的斑马  ·  Excel ...·  2 年前    · 
自信的胡萝卜  ·  Nosql-neo4j-Cypher 语句 ...·  2 年前    · 

图自监督学习(Graph Self-supervised Learning)最新综述+Github代码汇总

作者:LirongWu
转载自: 深度学习与图网络
原文链接:
Self-Supervised Learning has become an exciting direction in AI community.
  • Jitendra Malik: "Supervision is the opium of the AI researcher"
  • Alexei A. Efros: "The AI revolution will not be supervised"
  • Yann LeCun: "self-supervised learning is the cake, supervised learning is the icing on the cake, reinforcement learning is the cherry on the cake"

本综述来自西湖大学人工智能研究与创新中心(Center for AI Research and Innovation,Westlake University),对现有的图自监督学习技术进行了全面的回顾。实验室目前研究方向包括:图自监督与半监督学习,图结构优化,时序动态图,及其在生命科学等交叉领域的应用。欢迎优秀的同学申请实习访问,及优秀的博后加入我们。完整的综述请参照原文:

arxiv.org/abs/2105.0734

汇总了Github代码,之后会不定期持续更新图自监督学习相关的工作:

github.com/LirongWu/awe

近些年来,图上的深度学习在各种任务上取得了显著的成功,而这种成功在很大程度上依赖于海量的、精心标注的数据。然而,精确的标注通常非常昂贵和耗时。为了解决这个问题, 自监督学习 (Self-supervised Learning,SSL)正在成为一种全新的范式,通过精心设计的代理任务来提取富含语义信息的知识,而不依赖人工标注的数据。在本综述中,我们扩展了最早出现在计算机视觉和自然语言处理领域的自监督学习,对现有的图自监督学习(Graph Self-supervised Learning,Graph SSL)技术进行了及时且全面的回顾。具体地,本文将现有的Graph SSL方法分为三类: 对比式的、生成式的和预测式的 。更重要的是,与其它许多只对已发表研究进行high-level summary的综述不同,本文在一个统一的框架内对现有的工作进行了 详细的数学总结 (尽量做到一个公式描述一个方法)。此外,为了促进方法论的发展和公平的评估比较,本文还总结了常用的 数据集、评价指标、下游任务以及各种算法的开源实现 。最后,本文讨论了图自监督学习的技术挑战和潜在的改进方向。

1. 背景介绍

近年来,图上的深度学习已经成为人工智能领域的一个热门研究课题,然而大多数工作都集中在有监督或半监督学习的设置下,即通过特定的下游任务和丰富的标记数据来训练模型,而这些数据往往是有限的、昂贵的和不可获取的。由于严重依赖标签的数量和质量,这些监督或半监督方法很难适用于现实世界,特别是那些需要专家知识进行注释的场景,如医学、气象学等。更重要的是,这些方法容易出现 过拟合、泛化性差、鲁棒性弱 等问题。

自监督学习(SSL)的最新进展 [18,19] 为减少对标签的过度依赖,实现在大量无标注数据上的训练提供了新的见解。自监督学习的主要目标是通过精心设计的代理任务,从丰富的无标签数据中学习可迁移的知识,然后将学到的知识迁移到具有特定监督信号的下游任务中。最近,自监督学习在计算机视觉(CV)和自然语言处理(NLP) 领域的各项任务上都取得了令人惊喜的结果。用精心设计的代理任务进行自监督训练,有助于模型从丰富的无标签数据中学习更具有可泛化性的表征,从而在下游任务中获得更好的性能。受SSL在CV和NLP领域成功经验的启发,将SSL应用于图数据以充分利用图结构信息和丰富的无标记数据是一个重要而有前景的方向。然而,到目前为止,图上的SSL还没有得到充分的探索,许多重要的问题仍有待解决。

与图像和文本数据相比,SSL在图域的应用具有重要意义和巨大的潜在研究前景:

  • 首先,除了节点特征和部分已知的标签,图数据包含了揭示节点连接性的图结构,可以设计大量的代理任务来同时捕捉节点间潜在的语义关系。
  • 其次,现实世界的图通常是按照特定的规则形成的,例如,分子图中原子之间的连接受价键理论约束。因此,大量相关的领域知识可以作为先验被纳入到代理任务的设计中。
  • 最后,图结构数据一般支持归纳学习(transductive learning),如节点分类任务,这意味着在训练过程中,训练、验证和测试的样本特征都是可见的,这使得设计更多与特征相关的代理任务成为可能。

然而,这并不以意味着现有的一些用于图像或者文本的自监督技术可以直接迁移到图域中,欧几里得数据和非欧几里得数据的内在差异使得设计适用于图的自监督技术仍然非常具有挑战:

  • 首先,图像的拓扑结构是固定的网格,文本是简单的序列,而图则不限于这些刚性结构。
  • 其次,与图像和文本中数据的独立同分布假设不同,图中的节点是相互关联的,而不是完全独立的。这启发我们通过考虑节点属性和图结构来设计合适的代理任务。
  • 最后,由于自监督代理任务和下游任务的优化目标之间存在着差异,这种差异可能导致“负迁移”,将极大地损害模型的泛化性。因此,重新考虑代理任务的优化目标以使其更好地匹配下游任务的优化目标并使它们相互一致是至关重要的。

在本综述中,我们扩展了最早出现在计算机视觉和自然语言处理领域的SSL概念,对现有的图数据SSL技术进行了及时和全面的回顾。具体来说,我们将现有的图SSL方法分为三类:对比性的、生成性的和预测性的,如下图所示:

  1. 对比式方法 :对不同的增广 \mathcal{T}_{1}(\cdot) \mathcal{T}_{2}(\cdot) 产生的视图进行对比学习,将数据-数据对( inter-data )之间的共性和差异信息作为监督信号。
  2. 生成式方法 :关注图数据内部( intra-data )的信息,一般基于特征/结构重构等代理任务,利用图本身的特征和结构作为监督信号。
  3. 预测式方法 :通过一些简单的统计分析或专家知识self-generate伪标签,然后根据生成的伪标签设计基于预测的代理任务来处理数据-标签( data-label )关系。

接下来,我们从high-level上详细介绍这三种方法,并列举一些有代表性的方法作为例子,本综述的整体架构如下:

2. 训练策略

在深入介绍三种类型的图自监督技术之前,我们先介绍目前图SSL上常见的三种训练策略。考虑到编码器、代理任务和下游任务三者之间的关系,训练策略可以分为三种:

  • 预训练和微调(Pre-training and Fine-tuning)
  • 联合学习(Joint Learning)
  • 无监督表征学习(Unsupervised Representation Learning (URL)


它们详细的工作流程如上图所示,接下来我们对各个训练策略分别详细介绍:

2.1 预训练和微调(Pre-training and Fine-tuning)

在预训练阶段,编码器 f_{\theta}(\cdot) 在代理任务上被训练,然后预训练的参数 \theta_{i n i t} 被用来作为编码器 f_{\theta_{\text {init }}}(\cdot) 的初始化。在微调阶段,预训练的编码器 f_{\theta_{\text {init }}}(\cdot) 在特定下游任务的监督下与一个预测头 g_{\omega}(\cdot) 一起进行微调。优化目标如下:

\theta^{*}, \omega^{*}=\arg \min _{(\theta, \omega)} \mathcal{L}_{\text {task }}\left(f_{\theta}, g_{\omega}\right)

with initialization

\theta_{\text {init }}=\arg \min _{\theta} \mathcal{L}_{s s l}\left(f_{\theta}\right)

其中 \mathcal{L}_{t a s k} \mathcal{L}_{s s l} 分别是下游任务和自监督代理任务的损失函数。

2.2 联合学习(Joint Learning)

在这个方案中,编码器 f_{\theta}(\cdot) 与预测头 g_{\omega}(\cdot) 在代理任务和下游任务的监督下联合训练。这种联合学习策略也可以被认为是一种多任务学习,或者将自监督代理任务视为下游任务的正则化。优化目标如下:

\theta^{*}, \omega^{*}=\arg \min _{(\theta, \omega)} \mathcal{L}_{\text {task }}\left(f_{\theta}, g_{\omega}\right)+\alpha \arg \min _{\theta} \mathcal{L}_{s s l}\left(f_{\theta}\right)

其中 \alpha 是控制 \mathcal{L}_{t a s k} \mathcal{L}_{s s l} 损失权重的一个超参数。

2.3 无监督表征学习(Unsupervised Representation Learning)

这个训练策略的第一阶段类似于预训练,然而在第二阶段,预训练的参数 \theta_{\text {init }} 被固定,模型只在下游任务的监督下对frozen representations进行训练。优化目标如下:

\omega^{*}=\arg \min _{\omega} \mathcal{L}_{\text {task }}\left(f_{\theta_{\text {init }}}, g_{\omega}\right)

with initialization

\theta_{\text {init }}=\arg \min _{\theta} \mathcal{L}_{s s l}\left(f_{\theta}\right)

与其他策略相比,无监督表征学习更具挑战性,因为在预训练阶段没有来自下游任务的监督。

3. 对比式学习(Contrastive Learning)

介绍完三个常见的训练策略后,我们至此完成了对图自监督相关的概念,符号等背景知识的介绍,接下来我们将逐个介绍各种方法。由于近一年来Moco [18] 和SimCLR [19] 等算法大火,各种基于互信息最大化的对比学习方法层出不穷,对比式学习的自监督方法最为大家关注和熟悉,我们也将首先介绍这一类方法。在本综述中,我们从统一的角度回顾了现有的工作,并将它们统一到一个框架中。自监督对比式学习的三个主要模块是数据增广、代理任务设计和对比目标,现有工作的贡献基本上可以归纳为在这三个模块上的创新。

在实践中,我们一般通过各种的数据增广方式(甚至是它们的组合)为数据集中的每个实例生成多个视图。从同一实例中生成的两个视图通常被认为是一个正样本对,而从不同实例中生成的两个视图则被认为是一个负样本对。对比学习的主要目标是最大化两个联合采样的正样本对的一致性,最小化两个独立采样的负样本对的一致性。样本间的一致性通常通过互信息衡量。

考虑到一个给定的图 g=(\mathbf{A}, \mathbf{X}), \quad K 不同的增广变换 \mathcal{T}_{1}, \mathcal{T}_{1}, \cdots, \mathcal{T}_{K} 可用于获得多个视图 \left(\mathbf{A}_{k}, \mathbf{X}_{k}\right)_{k=1}^{K} , 定义如下:

\mathbf{A}_{k}, \mathbf{X}_{k}=\mathcal{T}_{k}(\mathbf{A}, \mathbf{X}) ; k=1,2, \cdots, K \\

其次,我们可以应用一组图编码器 \left\{f_{\theta_{k}}\right\}_{k=1}^{K} \quad (可以是不同的或共享权重) 为每个视图中生成对应的 表征 \mathbf{h}_{1}, \mathbf{h}_{2}, \cdots, \mathbf{h}_{K} , 如下 :

\mathbf{h}_{k}=f_{\theta_{k}}\left(\mathbf{A}_{i}, \mathbf{X}_{i}\right) ; k=1,2, \cdots, K \\

对比学习的优化目标是使同一实例的两个视图的相互信息最大化,表述为

\max _{\theta_{1}, \theta_{2}, \cdots, \theta_{K}} \sum_{i} \sum_{j \neq i} \alpha_{i, j} \mathcal{M} \mathcal{I}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right) \\

其中 i, j \in\{1,2, \cdots, K\},\left\{\mathbf{h}_{i}\right\}_{i=1}^{K} g=(\mathbf{A}, \mathbf{X}) 生成的表征,它们可以被视为正样本。与 \left\{\mathbf{h}_{i}\right\}_{i=1}^{K} 对比的负样本是由另一个图 \tilde{g}=(\widetilde{\mathbf{A}}, \widetilde{\mathbf{X}}) 生成的表征,即 \left\{\tilde{\mathbf{h}}_{i}\right\}_{i=1}^{K} 。此外,我们有 \alpha_{i, j} \in\{0,1\} , 它的具体取值在不同的方案设计中不同。 \mathcal{MI}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right) 是两个表征 \mathbf{h}_{i} \mathbf{h}_{j} 之间的互信息。需要注意的是,根据不同的代理任务, \left\{\mathbf{h}_{k}\right\}_{k=1}^{K} 可能不在同一尺度,可能是节点层次,子图层次,或者图层次的表征。

图数据的对比学习设计可以概括为三个主要模块:(1)数据增广策略;(2)代理任务;和 (3)对比目标函数。图编码器的设计不是图自监督学习的重点,更多的细节请参考相关综述 [15]。接下来,我们将依次介绍数据增广策略,代理任务设计,和常见的对比目标函数。

3.1 数据增广策略

近期计算机视觉领域的相关工作表明,基于对比学习的视觉表征学习的成功在很大程度上依赖于精心设计的数据增广策略,特别是某些类型的数据增广在提高性能方面起着非常重要的作用。然而,由于图数据固有的非欧几里得特性,很难将为图像设计的数据增广策略直接应用于GNN领域。在这里,我们把针对图数据的数据增广策略分为以下四类:基于特征的增广、基于结构的增广、基于采样的增广和自适应的增广。下图为四种增广策略的示意图:


3.1.1 基于特征的增广

给定一个输入图 (\mathbf{A}, \mathbf{X}) , 基于特征的增广只对节点特征矩阵 \mathbf{X} 或边特征矩阵 \mathbf{X}^{e} 进行变换。我们 以 \mathbf{X} 为例,变换如下:

\widetilde{\mathbf{A}}, \widetilde{\mathbf{X}}=\mathcal{T}(\mathbf{A}, \mathbf{X})=\mathbf{A}, \mathcal{T}_{\mathbf{X}}(\mathbf{X}) \\

  • Attribute Masking Attribute Masking 随机掩码掉一小部分节点或者边特征,如下定义:

\mathcal{T}_{\mathbf{X}}(\mathbf{X})=\mathbf{X} \odot(1-\mathbf{L})+\mathbf{M} \odot \mathbf{L} \\

其中 \mathbf{L} 是一个掩码位置指示矩阵,矩阵 \mathbf{L} 通常由Bernoulli分布取样或手动分配。 \mathbf{M} 的不同方案 会导致不同的增广策略。例如, \mathbf{M}=\mathbf{0} 表示常数掩码, \mathbf{M} \sim N(\mathbf{0}, \mathbf{\Sigma}) 表示用高斯噪声替换原始 值, \mathbf{M} \sim N(\mathbf{X}, \mathbf{\Sigma}) 表示将高斯噪声添加到输入中。

  • Attribute Shuffling Attribute Shuffling对节点特征矩阵 \mathbf{X} 的各行进行打乱。也就是说,变换后的图拥有与原图相同 的节点组成,但它们位于图中的不同位置,因此收到不同的上下文信息,定义如下:

\mathcal{T}_{\mathbf{X}}(\mathbf{X})=\mathbf{X}[i d x,:] \\

其中 i d x 是一个包含从1到 N 数值的随机排列。

3.1.2 基于结构的增广

给定一个图 (\mathbf{A}, \mathbf{X}) , 基于结构的增广只对邻接矩阵 \mathbf{A} 进行变换,如下所示

\widetilde{\mathbf{A}}, \widetilde{\mathbf{X}}=\mathcal{T}(\mathbf{A}, \mathbf{X})=\mathcal{T}_{\mathbf{A}}(\mathbf{A}), \mathbf{X} \\

Edge Perturbation (边扰动 )

边扰动过随机添加或删除一定比例的边来扰乱结构连接,定义如下

\mathcal{T}_{\mathbf{A}}(\mathbf{A})=\mathbf{A} \odot(1-\mathbf{L})+(1-\mathbf{A}) \odot \mathbf{L} \\

其中 \mathbf{L} 是一个扰动位置指示矩阵,如果节点 i 和节点 j 之间的连接将被扰动,则 \mathbf{L}_{i, j}=\mathbf{L}_{j, i}=1 否则 \mathbf{L}{i,j}=\mathbf{L}{j,i}=0 .

Node Insertion (节点插入)

节点插入向节点集 \mathcal{V} 中添加 K 个节点 \mathcal{V}_{a}=\left\{v_{N+k}\right\}_{k=1}^{K} , 并在 \mathcal{V}_{a} \mathcal{V} 之间添加一些边。对于结 构增广 \widetilde{\mathbf{A}}=\mathcal{T}_{\mathbf{A}}(\mathbf{A}) , 我们有 \widetilde{\mathbf{A}}_{: N,: N}=\mathbf{A} 。对于连接率 r , 我们有

p\left(\widetilde{\mathbf{A}}_{i, j}=\widetilde{\mathbf{A}}_{j, i}=1\right)=r, p\left(\widetilde{\mathbf{A}}_{i, j}=\widetilde{\mathbf{A}}_{j, i}=0\right)=1-r \\

其中 N+1 \leq i, j \leq N+K

Edge Diffusion (边扩散)

边扩散在节点之间建立新的连接。常见的边扩散如Personalized PageRank, 定义为:

\mathcal{T}_{\mathbf{A}}(\mathbf{A})=\alpha\left(\mathbf{I}_{n}-(1-\alpha) \mathbf{D}^{-1 / 2} \mathbf{A} \mathbf{D}^{-1 / 2}\right)^{-1} \\

3.1.3 基于采样的增广

给定一个输入图 (\mathbf{A}, \mathbf{X}) , 基于采样的增广同时对邻接矩阵 \mathbf{A} 和特征矩阵 \mathbf{X} 进行变换,如下所示

\widetilde{\mathbf{A}}, \widetilde{\mathbf{X}}=\mathcal{T}(\mathbf{A}, \mathbf{X})=\mathbf{A}[\mathcal{S}, \mathcal{S}], \mathbf{X}[\mathcal{S},:] \\

其中 \mathcal{S} \in \mathcal{V} ,现有的方法通常采用五种策略来获得节点子集 \mathcal{S}: 均匀采样、自网络采样、随机游走 采样、重要性采样和基于知识采样。

Uniform Sampling (Node Dropping)

均匀采样从 \mathcal{V} 中均匀地抽取给定数量的节点 \mathcal{S} , 并直接移除剩余的节点 \mathcal{D}=\mathcal{V} / \mathcal{S}

Ego-net Sampling

给定一个 L 层的图编码器,每个节点表征的计算只取决于其 L -hop的邻域。对于图中的每个节点 i , 自网络采样对节点 i 周围的 L -hop邻域行采样 \mathcal{S} , 定义如下

\mathcal{S}=\left\{v_{j} \mid d\left(v_{i}, v_{j}\right) \leq L\right\} \\

其中 d\left(v_{i}, v_{j}\right) 是节点 i j 之间的最短路径长度。Ego-nets采样本质上是广度优先搜索(BFS ) 采样的一个特殊版本。

Random Walk Sampling

随机游走采样从起始节点 i 开始在图上进行随机游走。游走以与边权重成正比的概率迭代地前往其 邻域。此外,在每一步以正概率 \alpha 返回到起始节点 i 。最后,被访问的节点被纳入一个节点子 \mathcal{S} 中。

Importance Sampling [5]

对于一个给定的节点 i , 重要性采样根据其相邻节点的重要性对子图进行采样。具体地,它计算出一个重要性评分矩阵 \mathbf{M} , 表示为

\mathbf{M}=\alpha \cdot\left(\mathbf{I}_{n}-(1-\alpha) \cdot \mathbf{A} \mathbf{D}^{-1}\right) \\

其中 \alpha \in[0,1] 是超参数。对于一个给定的节点 i , 子图采样器选择前 k 个重要的邻居来构成一个 子图, 所选节点的索引表示为 \mathcal{S}=\operatorname{top}_{-} \operatorname{rank}(\mathbf{M}(i,:), k)

Knowledge Sampling [12]

基于知识的采样将领域知识纳入到子图采样中。例如,通过计算分子图中经常出现的、与生物信息学的子结构,并为它们建立库(或表),子图采样可以被定义为一个基于库的匹配问题。

3.1.4 自适应增广

自适应增广通常采用注意力分数或梯度来指导节点或边的选择。

Attention-based

基于注意力的方法通常为节点或边定义重要性分数,然后根据其重要性来数据。例如, GCA [13] 保 持重要的结构和属性不变,而对不重要的边和特征扰动。具体来说,去除边和掩盖特征的概率应该与 它们的重要性密切相关。给定一个节点中心性度量 \varphi_{c}(\cdot): \mathcal{V} \rightarrow \mathbb{R}^{\lrcorner} , 它将边中心性定义为两个相 邻节点中心性得分的平均, 即 s_{i, j}=\log \frac{\varphi_{c}\left(v_{i}\right)+\varphi_{c}\left(v_{j}\right)}{2} 。然后,边 e_{i, j} 的重要性被定义为:

p_{i, j}=\min \left(\frac{s_{\max }-s_{i, j}}{s_{\max }-\mu_{s}} \cdot p_{e}, p_{\tau}\right) \\

其中, p_{e} 是一个超参数,控制去除边的总体概率, s_{\max } \mu_{s} \left\{s_{i, j}\right\}_{j=1}^{N} 的最大值和平均值, p_{\tau}<1 是一个截止概率。根据节点重要性进行采样与上面一样,这里不再重复。

Gradient-based

与GRACE [3] 中的简单的均匀边删除和插入不同,GROC [14] 在边梯度信息的指导下自适应地进 行基于梯度的增广。具体来说,它首先对 (\mathbf{A}, \mathbf{X}) 应用两个随机增广来获得两个视图 \left(r_{1}\right. r_{2} 的 概率分别掩码节点特征 ) , 然后计算这两个视图间的对比损失 \mathcal{L}_{\text {self。 }} 对于一个给定的节点 i , 一个 边移除候选集被定义为:

\mathcal{S}^{-}=\left\{\left(v_{i}, v_{k}\right) \mid v_{k} \in \mathcal{N}_{i}^{(l)}\right\} \\

边插入候选集被定义为:

\mathcal{S}^{+}=\left\{\left(v_{i}, v_{k}\right) \mid v_{k} \in\left(\cup_{v_{m} \in \mathcal{B}} \mathcal{N}_{m}^{(l)} \backslash \mathcal{N}_{i}^{(l)}\right)\right\} \\

其中 \mathcal{B} 是一个节点批次。最后,我们反向传播损失 \mathcal{L}_{\text {self }} , 以获得 \mathcal{S}^{-} \mathcal{S}^{+} 中每个边的梯度幅度 值,然后删除了 \mathcal{S}^{-} 中具有最小边梯度值的子集,并在 \mathcal{S}^{+} 中插入了具有最大边梯度值的子集。

3.2 对比式学习:代理任务

对比学习的目的是最大化提高两个联合采样的正样本对的一致性。根据视图的定义,视图的尺度可能是局部的、上下文的或全局的,对应于图中的节点层次、子图层次或图层次信息。因此,对比性学习可能会在相同或不同的尺度上对两个视图进行对比 ,这导致了两个类别: (1)同尺度对比;(2)跨尺度的对比 。同尺度对比中的两个视图,无论是正样本对还是负样本对,都处于同一尺度,而跨尺度对比中的两个视图具有不同的尺度,如节点-子图或节点-图对比。下图中给出了两种类别的对比方式的示意图:


3.2.1 同尺度对比

同尺度对比可以被进一步细化为3类:local-local contrasting, context-context contrasting, and global-global contrasting,我们接下来分别以一个代表性的算法来介绍它们。

Global-Global contrasting

GraphCL [1] 是一种典型的Global-Global对比方法。给定一个图 g_{i}=\left(\mathbf{A}_{i}, \mathbf{X}_{i}\right) \in \mathcal{G} , 它首先应 用一系列数据增广,生成一个增广图 \tilde{g}_{i}=\left(\widetilde{\mathbf{A}}_{i}, \widetilde{\mathbf{X}}_{i}\right)=\mathcal{T}\left(\mathbf{A}_{i}, \mathbf{X}_{i}\right) , 然后预测它们是否来自同一个 图。具体地,一个图 编 码 器 f_{\theta}(\cdot) \quad \mathrm{READOUT} 函 数 被用 于获取 图层次 表 征 \mathbf{h}_{g_{i}}=\operatorname{READOUT}\left(f_{\theta}\left(\mathbf{A}_{i}, \mathbf{X}_{i}\right)\right) \tilde{\mathbf{h}}_{\tilde{g}_{i}}=\operatorname{READOUT}\left(f_{\theta}\left(\widetilde{\mathbf{A}}_{i}, \widetilde{\mathbf{X}}_{i}\right)\right) , 学习目标被定义为 :

\max _{\theta} \frac{1}{|\mathcal{G}|} \sum_{g_{i} \in \mathcal{G}} \mathcal{M I}\left(\mathbf{h}_{g_{i}}, \tilde{\mathbf{h}}_{\tilde{g}_{i}}\right) \\

其中与 \mathbf{h}_{g_{i}} 对比的负样本是 \operatorname{Neg}\left(\mathbf{h}_{g_{i}}\right)=\left\{\tilde{\mathbf{h}}_{\tilde{g}_{j}}\right\}_{g_{j} \in \mathcal{G}, j \neq i} \circ Contrastive Self-supervised Learning (CSSL) [21] 遵循一个与GraphGL非常相似 (几乎相同) 的框架,不同之处仅在于数据增广方 式。除了丢弃节点外,它还将节点插入作为一种重要的增广策略。具体来说,它随机选择一个强连接 的子图 S , 删除 S 中的所有边,增加一个新的节点 i ,并在节点 i S 中的每个节点之间增加一 条边。

Context-Context contrasting

Graph Contrastive Coding (GCC) [2]是一个图自监督的预训练框架,它可以捕捉到多个图的通 用图拓扑特性。GCC首先对每个图 g \in \mathcal{G} 的通过随机游走采样多个子图,并将所有子图放入一个 memory bank \mathcal{S} 。然后, query graph g_{q} \in \mathcal{S} 和 key graphs g_{k} \in \mathcal{S} 分别由两个图编码器 f_{\gamma_{q}(\cdot)} f_{\gamma_{k}}(\cdot) 进行编码,得到低维表征 \mathbf{h}_{g_{q}} \mathbf{h}_{g_{k}} 。如果 \mathbf{h}_{g_{q}} \mathbf{h}_{g_{k}} 是从同一个图中采样的,那 么它们被认为是正样本对,否则就是负样本对。对于query graph \left(g_{q}, y_{q}\right) , 其中 y_{q} 是其采样的图 的索引。最后,学习目标被定义为:

\max _{\gamma_{q}} \log \frac{\sum_{i=1}^{|\mathcal{S}|} \mathbf{1}_{y_{i}=y_{q}} \cdot \exp \left(\mathbf{h}_{g_{q}} \cdot \mathbf{h}_{g_{k}}^{(i)} / \tau\right)}{\sum_{i=1}^{|S|} \exp \left(\mathbf{h}_{g_{q}} \cdot \mathbf{h}_{g_{k}}^{(i)} / \tau\right)} \\

其中 \mathbf{1}_{y_{i}=y_{q}} 是一个指标函数,用于确定memory bank中第 i 个key graph g_{k}^{(i)} 和query graph g_{q} 是否取自同一个图。 f_{\gamma_{k}}(\cdot) 的参数 \gamma_{k} 按照基于动量的方式更新:

\gamma_{k} \prec-\alpha \gamma_{k}+(1-\alpha) \gamma_{q} \\

Local-Local contrasting

GRACE [3]专注于节点层次的对比学习。给定图 g=(\mathbf{A}, \mathbf{X}) , 它首先生成两个增广的视图 g^{(1)}=\left(\mathbf{A}^{(1)}, \mathbf{X}^{(1)}\right)=\mathcal{T}_{1}(\mathbf{A}, \mathbf{X}) g^{(2)}=\left(\mathbf{A}^{(1)}, \mathbf{X}^{(2)}\right)=\mathcal{T}_{2}(\mathbf{A}, \mathbf{X}) 。然后, 它应用图编码器 f_{\theta}(\cdot) 生成节点嵌入 \mathbf{H}^{(1)}=f_{\theta}\left(\mathbf{A}^{(1)}, \mathbf{X}^{(1)}\right) \mathbf{H}^{(2)}=f_{\theta}\left(\mathbf{A}^{(2)}, \mathbf{X}^{(2)}\right) 。最后, 每个样本对 \left(\mathbf{h}_{i}^{(1)}, \mathbf{h}_{i}^{(2)}\right) 的成对损失被定义为:

\mathcal{L}\left(\mathbf{h}_{i}^{(1)}, \mathbf{h}_{i}^{(2)}\right)=\log \frac{e^{\mathcal{D}\left(\mathbf{h}_{i}^{(1)}, \mathbf{h}_{i}^{(2)}\right) / \tau}}{e^{\mathcal{D}\left(\mathbf{h}_{i}^{(1)}, \mathbf{h}_{i}^{(2)}\right) / \tau}+N e g} \\

其中 N e q 被定义为:

N e g=\sum_{k=1}^{N} \mathbf{1}_{k \neq i}\left[e^{\mathcal{D}\left(\mathbf{h}_{i}^{(1)}, \mathbf{h}_{k}^{(1)}\right) / \tau}+e^{\mathcal{D}\left(\mathbf{h}_{i}^{(1)}, \mathbf{h}_{k}^{(2)}\right) / \tau}\right] \\

其中 e^{\mathcal{D}\left(\mathbf{h}_{i}^{(1)}, \mathbf{h}_{k}^{(1)}\right) / \tau} 是intra-view的负样本对, e^{\mathcal{D}\left(\mathbf{h}_{i}^{(1)}, \mathbf{h}_{k}^{(2)}\right) / \tau} 是inter-view的负样本对。最后,要最 大化的总体优化目标被定义为:

\max _{\theta} \frac{1}{2 N} \sum_{i=1}^{N}\left[\mathcal{L}\left(\mathbf{h}_{i}^{(1)}, \mathbf{h}_{i}^{(2)}\right)+\mathcal{L}\left(\mathbf{h}_{i}^{(2)}, \mathbf{h}_{i}^{(1)}\right)\right] \\

GCA [13] 和GROC [14] 采用与GRACE相同的框架和目标,但拥有更加灵活和自适应的数据增广策略。

3.2.2 跨尺度对比 跨尺度对比可以被进一步细化为3类:local-context contrasting, local-global contrasting, and context-global contrasting,我们接下来分别以一个代表性的算法来介绍它们。

Local-Global Contrasting

Deep Graph Infomax (DGI) [4] 被提出用于执行Local-Global Contrasting。首先,它应用一 个增广变换 \mathcal{T}(\cdot) 来获得一个负样本 \tilde{g}=(\widetilde{\mathbf{A}}, \widetilde{\mathbf{X}})=\mathcal{T}(\mathbf{A}, \mathbf{X}) , 然后将两个图分别通过两个图编码 器 f_{\theta_{1}}(\cdot) f_{\theta_{2}}(\cdot) 得到嵌入矩阵 \widetilde{\mathbf{H}}=f_{\theta_{1}}(\widetilde{\mathbf{A}}, \widetilde{\mathbf{X}}) \mathbf{H}=f_{\theta_{2}}(\mathbf{A}, \mathbf{X}) 。此外, \mathrm{DGI应用一个~} \mathrm{READOUT} 函数来获得图层次的表征 \tilde{\mathbf{h}}_{\tilde{g}}=\mathrm{READOUT}(\widetilde{\mathbf{H}}) 。最后,学习目标定义如下:

\max _{\theta_{1}, \theta_{2}} \frac{1}{|\mathcal{V}|} \sum_{v_{i} \in \mathcal{V}} \mathcal{M I}\left(\tilde{\mathbf{h}}_{\tilde{g}}, \mathbf{h}_{i}\right) \\

其中 \mathbf{h}_{i} 是节点 i 的节点嵌入。与 \tilde{\mathbf{h}}_{\tilde{g}} 对比的负样本是 N e g\left(\tilde{\mathbf{h}}_{\tilde{g}}\right)=\left\{\mathbf{h}_{j}\right\}_{v_{j} \in \mathcal{V}, j \neq i}

Local-Context contrasting

SUBG-CON [5]通过利用中心 (针) 节点和其周围子图之间的强关联性来捕捉上下文结构信息。给 定一个图 g=(\mathbf{A}, \mathbf{X}), \quad SUBG-CON首先从 \mathcal{V} 中选取一个针节点集 \mathcal{S} , 然后通过重要性采样策略 得到其上下文子图 \left\{g_{i}=\left(\mathbf{A}^{(i)}, \mathbf{X}^{(i)}\right)\right\}_{i=1}^{|\mathcal{S}|} 。然后应用共享图编码器 f_{\theta}(\cdot) \operatorname{READOUT} 获得节 点嵌入 \left\{\mathbf{H}^{(1)}, \mathbf{H}^{(2)}, \cdots, \mathbf{H}^{(|\mathcal{V}|)}\right\}\left(\mathbf{H}^{(i)}=f_{\theta}\left(\mathbf{A}^{(i)}, \mathbf{X}^{(i)}\right)\right) 和图层次表征 \left\{\mathbf{h}_{g_{1}}, \mathbf{h}_{g_{2}}, \cdots, \mathbf{h}_{g_{\mid \nu}}\right\} 其中 \mathbf{h}_{g_{i}}=\operatorname{READOUT}\left(\mathbf{H}^{(i)}\right) 。最后,学习目标被定义为 :

\max _{\theta} \frac{1}{|\mathcal{S}|} \sum_{v_{i} \in \mathcal{S}} \mathcal{M} \mathcal{I}\left(\mathbf{h}_{i}^{(i)}, \mathbf{h}_{g_{i}}\right) \\

其中 \mathbf{h}_{i}^{(i)} 是节点嵌入矩阵 \mathbf{H}^{(i)} 中针节点 i 的表征嵌入。与 \mathbf{h}_{i}^{(i)} 对比的负样本是 \operatorname{Neg}\left(\mathbf{h}_{i}^{(i)}\right)=\left\{\mathbf{h}_{g_{j}}\right\}_{v_{j} \in \mathcal{S}, j \neq i}

Context-Global contrasting

InfoGraph [6]旨在获得图层次的表征嵌入。给定一个图 g=(\mathbf{A}, \mathbf{X}) , 它首先应用数据增广, 得 到 \tilde{g}=(\widetilde{\mathbf{A}}, \widetilde{\mathbf{X}})=\mathcal{T}(\mathbf{A}, \mathbf{X}) 。然后应用共享的 L 层图编码器 f_{\theta}(\cdot) 来获得每层的节点嵌入矩阵 \left\{\mathbf{H}^{(l)}\right\}_{l=1}^{L} \left\{\widetilde{\mathbf{H}}^{(l)}\right\}_{l=1}^{L} 。 然 后, 它 把从每 - 层 学 到 的 表 征连 接 起 来, 得 到 \mathbf{h}_{i}=\operatorname{CONCAT}\left(\left\{\mathbf{h}_{i}^{(l)}\right\}_{l=1}^{L}\right) \tilde{\mathbf{h}}_{i}=\operatorname{CONCAT}\left(\left\{\tilde{\mathbf{h}}_{i}^{(l)}\right\}_{l=1}^{L}\right) 。其中 \mathbf{h}_{i}^{(l)} 是节点 i 在节点嵌入矩阵 \mathbf{H}^{(l)} 中 的 嵌 入。此 外, - 个 \quad READOUT 函 数 被 用 来 获 得 图 层 次 的 表 征 \mathbf{h}_{g}=\operatorname{READOUT}\left(\left\{\mathbf{h}_{i}\right\}_{i=1}^{N}\right) 。最后,学习目标被定义如下:

\max _{\theta} \sum_{g \in \mathcal{G}} \frac{1}{|g|} \sum_{v_{i} \in g} \mathcal{M I}\left(\mathbf{h}_{g}, \mathbf{h}_{i}\right) \\

其中与 \mathbf{h}_{g} 对比的负样本是 N e g\left(\mathbf{h}_{g}\right)=\left\{\tilde{\mathbf{h}}_{i}\right\}_{v_{i} \in \mathcal{V}} .

3.3 对比目标函数

对比学习将两个表征 \mathbf{h}_{i} \mathbf{h}_{j} 视为随机变量,并将它们之间的相互信息最大化, 公式如下:

\mathcal{M I}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)=\mathbb{E}_{p\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)}\left[\log \frac{p\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)}{p\left(\mathbf{h}_{i}\right) p\left(\mathbf{h}_{j}\right)}\right] \\

为了更高效地估计对比学习中的相互信息,三种相互信息的下界形式已经被推导出,可以通过最大化 互信息的下限来间接地最大化相互信息。

Donsker-Varadhan估计器

Donsker-Varadhan估计器是KL divergence的一种表示形式, 是互信息的一种下界,定义为

\mathcal{M I}_{D V}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)=\mathbb{E}_{p\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)}\left[\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)\right]-\log \mathbb{E}_{p\left(\mathbf{h}_{i}\right) p\left(\mathbf{h}_{j}\right)}\left[e^{\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)}\right] \\

其中 p\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right) 表示两个表征的联合分布,而 p\left(\mathbf{h}_{i}\right) p\left(\mathbf{h}_{j}\right) 表示两个表征的边缘分布之积。 \mathcal{D}: \mathbb{R}^{q} \times \mathbb{R}^{q} \rightarrow \mathbb{R} 是一个判别器,它将两个输入映射到一个一致性分数。一般来说,判别器 \mathcal{D} 可 以选择应用额外的预测头 g_{\omega}(\cdot) \mathbf{h}_{i} 映射到 \mathbf{z}_{i}=g_{\omega}\left(\mathbf{h}_{i}\right) , 然后再计算一致分数,其中 g_{\omega}(\cdot) 可以 是线性映射、非线性映射 ( 例如MLP ) , 甚至是一个非参数的恒等映射 \left(\mathbf{z}_{i}=\mathbf{h}_{i}\right) 。判别器 \mathcal{D} \mathcal{D}\left(\mathbf{z}_{i}, \mathbf{z}_{j}\right)=\mathbf{z}_{i}^{T} \mathbf{z}_{j} / \tau , 余弦相似度 \mathcal{D}\left(\mathbf{z}_{i}, \mathbf{z}_{j}\right)=\frac{\mathbf{z}_{i}^{T} \mathbf{z}_{j}}{\left\|\mathbf{z}_{i}\left|\left\|\mid \mathbf{z}_{j}\right\|\right.\right.} 等。

Jensen-Shannon估计器

用JS divergence代替KL divergence, 我们推导出另一个Jensen-Shannon估计器,可以更有效 地估计和优化相互信息。Jensen-Shannon估计器被定义为:

\mathcal{M I}_{J S}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)=\mathbb{E}_{p\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)}\left[\log \left(\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)\right)\right]-\log \mathbb{E}_{p\left(\mathbf{h}_{i}\right) p\left(\mathbf{h}_{j}\right)}\left[\log \left(1-\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)\right)\right] \\

InfoNCE估计器

InfoNCE是最受欢迎的互信息下限估计器之一,其被定义为

\mathcal{M} \mathcal{I}_{N C E}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)=\mathbb{E}_{p\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)}\left[\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)-\mathbb{E}_{K \sim \mathcal{P}^{N}}\left[\log \frac{1}{N} \sum_{\mathbf{h}_{j}^{\prime} \in K} e^{\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}^{\prime}\right)}\right]\right] \\

其中 K 由N个随机变量组成,这些随机变量是从一个相同的独立分布中采样的。对于图分类问题, \mathrm{InfoNCE实际是在大小为~} \mathrm{N}+1 的批次 \boldsymbol{B} 上计算,上式可以被重写为 (丢掉log \mathrm{N}) :

\mathcal{M I}_{N C E}=-\frac{1}{N+1} \sum_{(\mathbf{A}, \mathbf{X}) \in B}\left[\log \frac{e^{\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)}}{\sum_{\left(\mathbf{A}^{\prime}, \mathbf{X}^{\prime}\right) \in B \backslash\{(\mathbf{A}, \mathbf{X})\}} e^{\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}^{\prime}\right)}}\right] \\

其中 \mathbf{h}_{i}, \mathbf{h}_{j} 是来自同一个图 g=(\mathbf{A}, \mathbf{X}) 的正样本对; 而 \mathbf{h}_{i} \mathbf{h}_{j}^{\prime} 是由图 g=(\mathbf{A}, \mathbf{X}) 和图 g^{\prime}=\left(\mathbf{A}^{\prime}, \mathbf{X}^{\prime}\right) 分别得到的负样本对。

Triplet Margin Loss

上述三个互信息估计器及其变体可以估计相互信息的下界。Triplet margin loss 则是一个非界限的 相互信估计器,它对互信息没有可证明的下界,而且优化它并不能保证互信息的最大化。Triplet margin loss 被定义为:

\mathcal{M I}_{\text {triplet }}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)=\mathbb{E}_{\left[(\mathbf{A}, \mathbf{X}),\left(\mathbf{A}^{\prime}, \mathbf{X}^{\prime}\right)\right] \sim \mathcal{G} \times \mathcal{G}}\left[\max \left\{\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}\right)-\mathcal{D}\left(\mathbf{h}_{i}, \mathbf{h}_{j}^{\prime}\right)+\epsilon, 0\right\}\right] \\

其中 \epsilon 是间隔值。

4. 生成式学习(Generative Learning)

与自监督对比式学习相比,生成式学习通常基于生成模型,将图数据本身的丰富信息作为一种自然的监督信号。在生成式方法中,预测头通常被称为图解码器,用来执行图重建的代理任务。按照重建的方式分类,我们将生成式方法总结为两类:(1) 图自编码 ,以once-for-all的方式进行图重建;(2) 图自回归 ,迭代地进行图重建。图自编码方法侧重于重建给定图数据的某些部分,如被掩码的特征或被破坏的邻接矩阵;而自回归方法则强调,给定部分图信息如属性或结构,然后以迭代的方式重建其余部分。

4.1 Graph Autoencoding

Node Attribute and Embedding Denoising

Node Attribute and Embedding Denoising [7] 是一个基于AE架构的代理任务,它通过向节点 特征添加噪声,以获得一个带噪的节点特征矩阵 \widehat{\mathbf{X}}=\mathbf{X}+N(\mathbf{0}, \mathbf{\Sigma}) , 然后强迫模型重建出干净的 节点特征 X ,其优化目标被定义为:

\mathcal{L}_{\text {self }}(\theta, \mathbf{A}, \widehat{\mathbf{X}})=\frac{1}{|\mathcal{V}|} \sum_{v_{i} \in \mathcal{V}}\left\|f_{\theta}(\mathbf{A}, \widehat{\mathbf{X}})_{v_{i}}-\mathbf{x}_{i}\right\|^{2} \\

同样地,我们也可以对嵌入特征矩阵加噪声, \widehat{\mathbf{H}}=\mathbf{H}+N(\mathbf{0}, \mathbf{\Sigma}) , 然后从中重建出干净的节点特 征矩阵 X , 定义为:

\mathcal{L}_{\text {self }}(\theta, \mathbf{A}, \widehat{\mathbf{H}})=\frac{1}{|\mathcal{V}|} \sum_{v_{i} \in \mathcal{V}}\left\|f_{\theta}(\mathbf{A}, \widehat{\mathbf{H}})_{v_{i}}-\mathbf{x}_{i}\right\|^{2} \\

实际上加噪只是破坏图像的一种手段,此外还有模糊、变灰等。受此启发,理论上可以使用任意函数 \mathcal{C}(\cdot) 来获得被破坏的特征,然后强迫模型进行重建。对于节点特征去噪,我们得到它的一个特殊的 变体 \mathcal{C}(\mathbf{X})=\mathbf{X}+N(\mathbf{0}, \mathbf{\Sigma}) 。基于任意函数 \mathcal{C}(\cdot) , 更正式的定义如下:

\mathcal{L}_{\text {self }}(\theta, \mathbf{A}, \mathcal{C}(\mathbf{X}))=\frac{1}{|\mathcal{V}|} \sum_{v_{i} \in \mathcal{V}}\left\|f_{\theta}(\mathbf{A}, \mathcal{C}(\mathbf{X}))_{v_{i}}-\mathbf{x}_{i}\right\|^{2} \\

4.2 Graph Autoregressive

  • GPT-GNN

近年来, GPT [17] 的思想也被应用到了 GNN 中。例如, GPT-GNN [8] 提出了一个自回归框架对 给定的图迭代地执行节点和边重建。给定一个图 g_{t}=\left(\mathbf{A}_{t}, \mathbf{X}_{t}\right) , 在每次迭代 t 中, GPT-GNN 生 成一个新的节点 X_{i} 及其连接边 E_{i} 来获得更新图 g_{t+1}=\left(\mathbf{A}_{t+1}, \mathbf{X}_{t+1}\right) , 并优化节点和边生成在 当前迭代 t+1 的似然,其优化目标定义为 :

\begin{aligned} & p_{\theta}\left(\mathbf{X}_{t+1}, \mathbf{A}_{t+1} \mid \mathbf{X}_{t}, \mathbf{A}_{t}\right) \\ =& \sum_{o} p_{\theta}\left(X_{i}, E_{i}^{\neg o} \mid E_{i}^{o}, \mathbf{X}_{t}, \mathbf{A}_{t}\right) \cdot p_{\theta}\left(E_{i}^{o} \mid \mathbf{X}_{t}, \mathbf{A}_{t}\right) \\ =& \mathbb{E}_{o}\left[p_{\theta}\left(X_{i}, E_{i}^{\neg o} \mid E_{i}^{o}, \mathbf{X}_{t}, \mathbf{A}_{t}\right)\right] \\ =& \mathbb{E}_{o}\left[p_{\theta}\left(\mathbf{X}_{t+1} \mid E_{i}^{o}, \mathbf{X}_{t}, \mathbf{A}_{t}\right) p_{\theta}\left(E_{i}^{\neg 0} \mid E_{i}^{o}, \mathbf{X}_{t+1}, \mathbf{A}_{t}\right)\right] \end{aligned} \\

其中 o 是一个变量, 用来表示在迭代 t E_{t} 内所有已知边的索引。因此, E_{t}^{o} 表示迭代 t 中已知 的边,而 E_{i}^{\succ o} 表示迭代 t+1 中的掩码边 (待生成边) 。最后,图生成过程被分解为节点特征生成 p_{\theta}\left(\mathbf{X}_{t \dashv 1} \mid E_{i}^{o}, \mathbf{X}_{t}, \mathbf{A}_{t}\right) 和边生成步骤 p_{\theta}\left(E_{i}^{\neg 0} \mid E_{i}^{o}, \mathbf{X}_{t \dashv 1}, \mathbf{A}_{t}\right) 。在实践中, GPT-GNN迭代地执 行节点和边生成。

5. 预测式学习(Predictive Learning)

对比式学习方法处理的是数据间(inter-data)的信息,生成式方法关注的是数据内(intra-data)的信息,而预测式方法的目的是将数据中的信息标签(self-generate informative labels)作为监督信号来处理数据-标签(data-label)的关系。按照标签的获取方式分类,我们将预测式方法总结为四类:(1) 节点属性预测 。节点的属性,如节点度,被预先计算并作为自监督的标签来执行预测任务。(2) 基于上下文的预测 。图中的局部或全局上下文信息可以被提取出来作为标签来辅助自监督学习,例如,通过预测节点之间的最短路径长度,模型可以捕捉到长距离的依赖关系,这有利于如链接预测等下游任务。(3) 自训练 。用前一阶段的预测或聚类得到的伪标签进行学习,然后对伪标签进行更新。(4) 基于领域知识的预测 。提前使用领域知识或专门工具来分析图数据(如生物或化学数据)以获得信息标签。如下是这四种预测式方法的示意图:


5.1 节点属性预测

  • Node-Property Prediction [9]

进行预测式学习的一个有效方法是利用图中隐含的数值属性,如常用的节点属性一一节点度和局部 聚类系数。节点属性预测任务首先定义了一个映射 \Omega: \mathcal{V} \rightarrow \mathcal{Y} 从图 g=(\mathbf{A}, \mathbf{X}) 中为每个节点 i 提 取统计标签 y_{i}=\Omega(\mathbf{A}, \mathbf{X})_{v_{i}} 。这个代理任务的学习目标被定义为

\mathcal{L}_{\text {self }}(\theta, \mathbf{A}, \mathbf{X})=\frac{1}{|\mathcal{V}|} \sum_{v_{i} \in \mathcal{V}}\left(f_{\theta}(\mathbf{A}, \mathbf{X})_{v_{i}}-y_{i}\right)^{2} \\

其中 f_{\theta}(\mathbf{A}, \mathbf{X}) 是预测的标签矩阵, f_{\theta}(\mathbf{A}, \mathbf{X})_{v_{i}} 是节点 i 的预测标签。由于节点属性不同,映射函 数 \Omega(\cdot) 可以有不同的设计。例如,如果我们用节点度作为自监督的局部节点属性,定义如下:

y_{i}=\Omega(\mathbf{A}, \mathbf{X})_{v_{i}}=\sum_{j=1}^{N} \mathbf{A}_{i, j} \\

对于局部聚类系数,我们有:

y_{i}=\Omega(\mathbf{A}, \mathbf{X})_{v_{i}}=\frac{2\left|\left\{\left(v_{m}, v_{n}\right) \mid v_{m} \in \mathcal{N}_{i}, v_{n} \in \mathcal{N}_{i}\right\}\right|}{\left|\mathcal{N}_{i}\left(\mathcal{N}_{i}-1\right)\right|} \\

其中,局部聚类系数是描述图中节点聚集程度的局部系数。除了上述两个属性,任何其他的节点属性 (甚至是它们的组合) 都可以作为统计标签来执行节点属性预测的代理任务。

5.2 基于上下文的预测

  • PairwiseDistance

Pairwise Distance [9] 是一种典型的基于上下文的代理任务,它旨在通过预测不同节点对之间的最 短路径长度,引导模型保留全局拓扑信息。具体地,它首先从所有节点对中随机抽取一定数量的节点 对 \left\{\left(v_{i}, v_{j}\right) \mid v_{i}, v_{j} \in \mathcal{V}\right\} , 并计算任意节点对 \left(v_{i}, v_{j}\right) \in \mathcal{S} 之间的最短路径长度 d_{i, j}=d\left(v_{i}, v_{j}\right) 。 此外,它将最短路径长度分为四类: C_{i, j}=0, C_{i, j}=1, C_{i, j}=2 C_{i, j}=3 , 分别 对应 d_{i, j}=1, d_{i, j}=2, d_{i, j}=3 d_{i, j} \geq 3 。最后,优化目标可以被形式化为一个多分类问题, 如下所 示:

\mathcal{L}_{\text {self }}(\theta, \omega, \mathbf{A}, \mathbf{X})=\frac{1}{|\mathcal{S}|} \sum_{\left(v_{i}, v_{i}\right) \in \mathcal{S}} \ell\left(f_{w}\left(\left|f_{\theta}(\mathbf{A}, \mathbf{X})_{v_{i}}-f_{\theta}(\mathbf{A}, \mathbf{X})_{v_{j}}\right|\right), C_{i, j}\right) \\

其中 \ell(\cdot) 表示交叉嫡损失, f_{\omega}(\cdot) 线性映射地将输入到一个的实数。与 \mathrm{S}^{2} \mathrm{GRL} [15] 的代理任务相 比,Pairwise Distance截断了超过4的最短路径, 主要是为了避免过大的计算负担,并防止非常嘈杂的超远距离点对主导优化进程。

5.3 自训练

  • Cluster Preserving [10]

现实世界图的一个重要特征是聚类结构,所以我们可以把族结构保持作为是一个自监督的代理任务。 首先应用无监督聚类算法将图中的节点分成 K 不重疊的族 \left\{C_{k}\right\}_{k=1}^{K} , 然后通过计算每个族的族原 型 c_{k}=\mathrm{AGGREGATE}\left(\left\{f_{\theta}(\mathbf{A}, \mathbf{X})_{v_{i}} \mid v_{i} \in C_{k}\right\}\right) 。映射函数 g_{\omega}(\cdot) 用于估计节点 i 与族原型 c_{k} 之间的相似度,例如,节点 i 属于族 C_{k} 的概率 \hat{y}_{i, k} 被定义如下:

\hat{y}_{i, k}=\frac{\exp \left(g_{\omega}\left(f_{\theta}(\mathbf{A}, \mathbf{X})_{v_{i}}, c_{k}\right)\right)}{\sum_{k=1}^{K} \exp \left(g_{\omega}\left(f_{\theta}(\mathbf{A}, \mathbf{X})_{v_{i}}, c_{k}\right)\right)} \\

最后,这个代理任务的优化目标被定义为 :

\mathcal{L}_{\text {self }}(\theta, \mathbf{A}, \mathbf{X})=-\frac{1}{|\mathcal{V}|} \sum_{v_{i} \in \mathcal{V}} \sum_{k=1}^{K} y_{i, k} \log \left(\hat{y}_{i, k}\right) \\

5.4 基于领域知识的预测

  • Graph-level Motif Prediction

Motif是分子图数据图数据中反复出现的子图。分子中的一类重要Motif是功能组,它编码了分子丰 富的领域知识,可以很容易地被专业软件(如RDCit) 检测到。假设我们考虑分子图可能存在的 K 种 Motif, 其集合记为 \mathcal{M}=\left\{m_{k}\right\}_{k=1}^{K} 。对一个特定分子图 g_{i} \in \mathcal{G} , Graph-level Motif Prediction [11] 检测每个Motif是否出现在 g_{i} 中,然后将其作为标签 \mathbf{y}_{i} \in \mathbb{R}^{K} , 如果 m_{k} 出现在 g_{i} 中,第 k 个元素 \mathbf{y}_{i, k} 将被设置为1,否则为0。从形式上看, Motif Prediction任务的学习目标 可以被表述为一个多标签分类问题,如下所示:

\mathcal{L}_{s e l f}(\gamma, \mathcal{G})=\frac{1}{|\mathcal{G}|} \sum_{g_{i} \in \mathcal{G}} \ell\left(f_{\gamma}\left(\mathbf{A}_{i}, \mathbf{X}_{i}\right), \mathbf{y}_{i}\right) \\

其中 \ell(\cdot) 表示二元交叉嫡损失。

6. 实现总结

  • 下表列出了本综述审阅的各个方法,适用图的属性、代理任务类型、数据增广策略、目标函数、训练策略和出版年份。


  • 下表展示了本综述审阅的工作的具体实现细节,如下游任务的(节点/链接/图)类型、特定任务的评价指标以及所用的数据集。


常用数据集的统计结果如下表,包括图类别、图数目、每张图的节点数、每张图的边数、节点属性的维度、类别数和采用该数据的论文。常用的图自监督学习任务的数据集可以分为五类:引文网络、社会网络、蛋白质网络、分子图和其他。

代码开源有利于对深度学习社区的发展。下表中列出了所调研工作的开源代码总结,我们提供了其开源代码的超链接,那些没有找到开源代码的作品用 "N.A "表示。这些方法大多基于Pytorch或Tensorflow库实现。此外,我们还创建了一个GitHub资源库:

github.com/LirongWu/awe

来总结图自监督学习技术的最新进展,随着更多论文及其代码的出现,该资源库将被不定期持续更新

7. 讨论:技术挑战与未来研究方向 尽管最近在CV和NLP领域取得了巨大成功,但将SSL应用于图数据仍然非常具有挑战性。在这一节中,我们分析了现有的图形SSL的技术挑战,并为未来的工作指出了一些有希望的方向。

复杂类型图的代理任务设计 目前大多数图SSL的工作都集中在属性图上,而对其他更复杂、更有挑战性的图类型,如时空和异构图,进行探索的工作还很少。目前大多数的代理任务只利用节点或边的特征,这限制了它们利用挖掘图中其它丰富信息的能力,如时空图中的时序信息和异构图形中的关系信息。一个有希望的方向是设计特定于图类型的代理任务,根据图的类型自适应挑选最合适的任务。

缺乏理论基础 尽管图SSL在各种任务上取得了巨大的成功,但它们大多借鉴了SSL在CV和NLP领域的成功经验。换句话说,大多数现有的图SSL方法都是凭直觉设计的,它们的性能提升是通过经验实验来评估的。由于设计背后缺乏足够的理论基础,导致了潜在性能瓶颈和可解释性差的问题。因此,从图论的角度为图SSL建立一个坚实的理论基础,尽量缩小理论基础和经验设计之间的差距也是一个有前途的未来方向。

增广策略研究不足 最近在视觉表征学习领域的进展主要归功于各种数据增广策略,如调整大小、旋转、着色等 [18,19]。然而,由于图数据固有的非欧几里得性质,很难将现有的基于CNN的数据增广直接应用于图数据。此外,目前大多数图上的数据增广策略仅限于添加/删除节点和边或它们的组合,以此实现所谓的SOTA。为了进一步提高图上SSL的性能,设计更有效的增广策略或为特定的下游任务自适应地进行增广是一个有前途的方向。此外,从 增广的数据中选择高质量的负样本也是一个关键问题。

缺乏可解释性 虽然现有的图SSL方法在各种下游任务上取得了优异的成绩,但我们仍然不知道自监督任务到底学到了什么?特征模式、重要结构还是特征-结构关系?这种学习是显性的还是隐性的?是否有可能在输入数据上找到可解释的对应关系?这些都是理解和解释模型行为的重要问题,但在目前的图SSL工作中却缺失了。因此,我们需要探索图SSL的可解释性,并对模型行为进行深入分析,以提高现有方法在涉及安全或隐私的下游任务中的通用性和稳健性。

预训练与下游任务的分歧 用自监督任务进行预训练,然后将预训练的模型用于特定的下游任务,通过微调或冻结权重,是图SSL中常见的训练策略 。然而,我们应该如何将预训练好的知识转移到下游任务中去呢?尽管在CV和NLP领域已经提出了大量的策略来解决这个问题 [20],但由于图数据固有的非欧氏结构,它们很难直接应用于GNN领域。因此,如何设计针对图的技术,使预训练和下游任务之间的优化分歧最小化,是一个重要问题。


Reference

[1] Y. You, T. Chen, Y. Sui, T. Chen, Z. Wang, and Y. Shen, “Graph contrastive learning with augmentations,”Advances in Neural Information Processing Systems, vol. 33, 2020.

[2] J. Qiu, Q. Chen, Y. Dong, J. Zhang, H. Yang, M. Ding, K. Wang, and J. Tang, “Gcc: Graph contrastive coding for graph neural network pre-training,” in Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, 2020, pp. 1150–1160.

[3] S. Thakoor, C. Tallec, M. G. Azar, R. Munos, P. Veliˇckovi´c, and M. Valko “Bootstrapped representation learning on graphs,” arXiv preprint arXiv:2102.06514, 2021.

[4] P. Velickovic, W. Fedus, W. L. Hamilton, P. Li` o, Y. Bengio, and R. D. Hjelm, “Deep graph infomax.” in ICLR (Poster), 2019.

[5] Y. Jiao, Y. Xiong, J. Zhang, Y. Zhang, T. Zhang, and Y. Zhu, “Sub-graph contrast for scalable selfsupervised graph representation learning,” arXiv preprint arXiv:2009.10273, 2020.

[6] F.-Y. Sun, J. Hoffmann, V. Verma, and J. Tang, “Infograph: Unsupervised and semi-supervised graphlevel representation learning via mutual information maximization,” arXiv preprint arXiv:1908.01000, 2019.

[7] F. Manessi and A. Rozza, “Graph-based neural network models with multiple self-supervised auxiliary tasks,” arXiv preprint arXiv:2011.07267, 2020.

[8] Z. Hu, Y. Dong, K. Wang, K.-W. Chang, and Y. Sun,“Gpt-gnn: Generative pre-training of graph neural networks,” in Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, 2020, pp. 1857–1867.

[9] W. Jin, T. Derr, H. Liu, Y. Wang, S. Wang, Z. Liu, and J. Tang, “Self-supervised learning on graphs: Deep insights and new direction,” arXiv preprint arXiv:2006.10141, 2020.

[10] Z. Hu, C. Fan, T. Chen, K.-W. Chang, and Y. Sun, “Pretraining graph neural networks for generic structural feature extraction,” arXiv preprint arXiv:1905.13728, 2019.

[11] Y. Rong, Y. Bian, T. Xu, W. Xie, Y. Wei, W. Huang, and J. Huang, “Self-supervised graph transformer on large-scale molecular data,” Advances in Neural Information Processing Systems, vol. 33, 2020.

[12] S. Zhang, Z. Hu, A. Subramonian, and Y. Sun, “Motifdriven contrastive learning of graph representations,”arXiv preprint arXiv:2012.12533, 2020.

[13] Y. Zhu, Y. Xu, F. Yu, Q. Liu, S. Wu, and L. Wang,“Graph contrastive learning with adaptive augmentation,”arXiv preprint arXiv:2010.14945, 2020.

[14] N. Jovanovi´c, Z. Meng, L. Faber, and R. Wattenhofer,“Towards robust graph contrastive learning,” arXiv preprint arXiv:2102.13085, 2021.

[15] Z. Peng, Y. Dong, M. Luo, X.-M. Wu, and Q. Zheng, “Self-supervised graph representation learning via global context prediction,” arXiv preprint arXiv:2003.01604, 2020.

[16] Z. Wu, S. Pan, F. Chen, G. Long, C. Zhang, and S. Y. Philip, “A comprehensive survey on graph neural networks,” IEEE transactions on neural networks and learning systems, 2020.

[17] A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, and I. Sutskever, “Language models are unsupervised multitask learners,” OpenAI blog, vol. 1, no. 8, p. 9, 2019.

[18] K. He, H. Fan, Y.Wu, S. Xie, and R. Girshick, “Momentum contrast for unsupervised visual representation learning,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 9729–9738.

[19] T. Chen, S. Kornblith, M. Norouzi, and G. Hinton, “A simple framework for contrastive learning of visual representations,” in International conference on machine learning. PMLR, 2020, pp. 1597–1607.

[20] F. Zhuang, Z. Qi, K. Duan, D. Xi, Y. Zhu, H. Zhu, H. Xiong, and Q. He, “A comprehensive survey on transfer learning,” Proceedings of the IEEE, vol. 109, no. 1, pp. 43–76, 2020.

[21] J. Zeng and P. Xie, “Contrastive self-supervised learning for graph classification,” arXiv preprint arXiv:2009.05923, 2020.


机器学习/深度学习算法/自然语言处理交流群

已建立机器学习算-自然语言处理微信交流群!想要进交流群进行学习的同学,可以直接加我的微信号: HIT_NLP 。加的时候备注一下: 知乎+学校+昵称 (不加备注不会接受同意,望谅解) ,想进 pytorch群,备注知乎+学校+昵称+Pytorch 即可。然后我们就可以拉你进群了。群里已经有非得多国内外高校同学,交流氛围非常好。

强烈推荐大家关注 机器学习算法与自然语言处理 账号和 机器学习算法与自然语言处理 微信公众号,可以快速了解到最新优质的干货资源。

推荐阅读

EMNLP 2021(征稿通知)+交流群

ACL-2021交流群

NAACL2021-交流群

写给新手炼丹师:2021版调参上分手册

知识蒸馏:让LSTM重返巅峰!

最强的Attention函数诞生啦,带给你意想不到的巨大提升!

新分类!全总结!最新Awesome-SLU-Survey资源库开源!

NaturalConv: 一个主题驱动的中文多轮对话数据集

NUS&A* STAR: 一种简单有效的数据增广方法for n-shot任务型对话系统

AAAI 2021 | 机器翻译最新进展解读

全领域涨点 | Transformer携Evolving Attention在CV与NLP领域全面涨点

Facebook AI大一统!使用统一Transfomer的多模态多任务学习

谷歌:提高长文本对话状态跟踪能力

推荐!李宏毅《机器学习》国语课程(2021)上线!

CVPR 2021接收结果出炉!录用1663篇,录取率27%

深度学习中的知识蒸馏技术(上)

大佬云集 AAAI 2021 图深度学习研讨会

【招人】腾讯广告业务线

赛尔笔记 | 篇章级机器翻译简介

GPT“高仿”系列开源了!最大可达GPT-3大小,还能自主训练

ACL 2021投稿避坑指南

我,大学没毕业,在OpenAI搞AI,想教教你如何提升“研究品味”

推荐几本经典AI书籍!

赛尔原创@AAAI 2021 | 纠结于联合学习中的建模方法?快来看看图网络显式建模!

如何提高PyTorch“炼丹”速度?这位小哥总结了17种方法,可直接上手更改的那种

斯坦福CS224W《图机器学习》2021开课!Jure Leskovec大牛主讲,附课程PPT下载

ICLR2021放榜!录取860篇,接受率为28.7%!

计算机视觉中的Transformer

第二十届中国计算语言学大会(CCL 2021)技术评测任务征集

完全图解GPT-2:看完这篇就够了(二)

完全图解GPT-2:看完这篇就够了(一)

IJCAI 2020今日开幕,杰出论文奖、卓越研究奖、约翰·麦卡锡奖等8项大奖公布!

研究品味锻炼!

一份Python线性代数讲义

全面回顾2020年图机器学习进展,12位大神论道、寄望2021年大爆发!

第二十届中国计算语言学大会(CCL 2021) 征稿启事

NTU-Xavier Bresson 图神经网络入门视频

2020年arXiv十大热门论文来了!不止GPT-3、SimCLR、YOLOv4...

每日论文速递:自然语言处理相关(1月7日更新版)

权值衰减和L2正则化傻傻分不清楚?

斯坦福大学——人工智能本科4年课程清单

超过500个附代码的AI/机器学习/深度学习/计算机视觉/NLP项目

Awesome Transformer for Vision Resources List库

2020 Top10计算机视觉论文总结:论文,代码,解读,还有demo视频!

摘要数据整理仓库,6个数据集!

156个参考文献!Visual Transformer 调研survey

NLP生成任务痛点!58页generation评价综述

机器学习画图模板ML Visuals更新

谷歌最新28页高效 Transformer 模型综述

Papers with Code 2020 全年回顾

最新14页《图神经网络可解释性》综述论文

陶大程等人编写!最新41页深度学习理论综述

使用PyTorch时,最常见的4个错误

加拿大蒙特利尔大学助理教授刘邦招收2021/2022年博士生

【EMNLP2020】基于动态图交互网络的多意图口语语言理解框架

一文搞懂 PyTorch 内部机制

忆臻:AAAI 2021论文接收列表放出!!!

机器学习自然语言处理:从头来看关系抽取

机器学习自然语言处理:Transformer的一家!

机器学习自然语言处理:通俗易懂!BiLSTM上的CRF,用命名实体识别任务来解释CRF(一)

机器学习自然语言处理:通俗易懂!BiLSTM上的CRF,用命名实体识别任务来解释CRF(二)

机器学习自然语言处理:赛尔笔记 | 自然语言处理领域的数据增广方法

机器学习自然语言处理:基于小样本学习的图像分类技术综述(中文版),19页pdf

机器学习自然语言处理:【斯坦福NLP-CS224N硬核课】自然语言处理未来与深度学习,81页ppt

机器学习自然语言处理:大道至简:算法工程师炼丹Trick手册

机器学习自然语言处理:Transformer!「预训练变换器文本排序」首篇综述书,155页pdf概述BERT类模型文本检索进展

机器学习自然语言处理:周志华老师《机器学习》手推笔记,214页

机器学习自然语言处理:原来有这个算法,让点评体验如此好!

机器学习自然语言处理:AAAI2020-图神经网络(GNN)过去、现在、应用和未来最新研究进展分享

机器学习自然语言处理:图神经网络(GNN)必读论文及最新进展跟踪

机器学习自然语言处理:5种神经网络常见的求导!

机器学习自然语言处理:一文概览 CVPR2021 最新18篇 Oral 论文

机器学习自然语言处理:CVPR2021最新接收论文合集!22个方向100+篇论文汇总|持续更新

机器学习自然语言处理:Transformer是巧合还是必然?搜索推荐领域的新潮流

机器学习自然语言处理:AAAI 2021最佳论文《Informer》作者:Transformer 最新进展

机器学习自然语言处理:[万字长文] 图神经网络的解释性综述

机器学习自然语言处理:图解Transformer(完整版)!

机器学习自然语言处理:【Transformer】图解OpenAI的秘密武器GPT-2:可视化Transformer语言模型

机器学习自然语言处理:搞懂Transformer结构,看这篇PyTorch实现就够了

机器学习自然语言处理:深度学习中的知识蒸馏技术(上)

机器学习自然语言处理:深度学习中的知识蒸馏技术(下)-知识蒸馏与推荐系统

机器学习自然语言处理:2021年,我终于决定入门GCN

机器学习自然语言处理:排序(rank)后重排(re-rank)?

机器学习自然语言处理:从理论到实践解决文本分类中的样本不均衡问题

机器学习自然语言处理:如何基于多模态识别广告文章

机器学习自然语言处理:总结+paper分享|对话系统中的自然语言生成技术(NLG)

机器学习自然语言处理:百家争鸣|国内外NLP领域学术界和工业界的牛人和团队

机器学习自然语言处理:任务型对话系统公式建模&&实例说明

机器学习自然语言处理:一文"看透"多任务学习

机器学习自然语言处理:总结+paper分享|对话系统中的自然语言生成技术(NLG)

机器学习自然语言处理:百家争鸣|国内外NLP领域学术界和工业界的牛人和团队

机器学习自然语言处理:收藏|2021年浅谈多任务学习

机器学习自然语言处理:CTR模型越来越"深",如何让它变"轻"?

机器学习自然语言处理:排序(rank)后重排(re-rank)?

赛尔笔记 | 对比学习简述 - 知乎 (zhihu.com)

20篇「ICML2021」最新论文抢先看!看机器学习2021在研究什么? - 知乎 (zhihu.com)

“意念打字”速度接近常人手机聊天,专家:这比马斯克的“猴子玩游戏”难多了 | Nature封面 - 知乎 (zhihu.com)

MLP三大工作超详细解读:why do we need? - 知乎 (zhihu.com)

近期必读的5篇顶会CVPR 2021【对比学习(CL)】相关论文和代码 - 知乎 (zhihu.com)

赛尔原创@IJCAI 2021 | 会议摘要有难度?快来引入对话篇章结构信息 - 知乎 (zhihu.com)

ViLT:最简单的多模态Transformer - 知乎 (zhihu.com)

台大最新《深度学习优化问题》硬核课,林智仁教授讲解,附课件下载 - 知乎 (zhihu.com)

Rethinking “Batch” in BatchNorm - 知乎 (zhihu.com)

文本情感对话系统研究综述 - 知乎 (zhihu.com)

写给新手炼丹师:2021版调参上分手册 - 知乎 (zhihu.com)

100+篇论文合集:GNN在NLP中的应用 - 知乎 (zhihu.com)

《自监督学习》概述,117页ppt,李飞飞经典CS231N2021《卷积神经网络视觉识别》课程第十三讲! - 知乎 (zhihu.com)

近期必读的5篇顶会ICML 2021【图神经网络(GNN)】相关论文和代码 - 知乎 (zhihu.com)

成熟的AI应该自己写代码,IBM发布5亿行代码数据集,包含55种语言|开源 - 知乎 (zhihu.com)

2021机器学习研究风向是啥?MLP→CNN→Transformer→MLP! - 知乎 (zhihu.com)

基于会话推荐系统最新长文综述,163篇参考文献,已被ACM Computing Surveys接收 - 知乎 (zhihu.com)

弗吉尼亚理工、滑铁卢大学、威斯康星大学、弗吉尼亚大学AI硕博招生! - 知乎 (zhihu.com)

UC伯克利马毅ICML投稿得到4个评审接收却仍遭AC拒绝!自称论文泄露了深度学习的天机 - 知乎 (zhihu.com)

TransGAN:两个Transformer可以构造一个强大的GAN - 知乎 (zhihu.com)

CHI2021最新「可解释人工智能XAI导论」,86页PPT带你实战XAI系统 - 知乎 (zhihu.com)

吊打BERT、GPT、DALL·E,跨模态榜单新霸主诞生! - 知乎 (zhihu.com)

拯救Sci-Hub的「最后行动」:把77TB论文,转化成850个BT种子传播下去 - 知乎 (zhihu.com)

【2021新书】概率图模型:原理与应用,370页pdf概述PGM最新技术 - 知乎 (zhihu.com)

为什么贝叶斯统计如此重要? - 知乎 (zhihu.com)

Github标星1.2K,Visual Transformer 最全最新资源,包含期刊、顶会论文 - 知乎 (zhihu.com)

赛尔笔记 | 可解释的自然语言处理方法简介 - 知乎 (zhihu.com)

深度学习三十问!一位算法工程师经历30+场CV面试后总结的常见问题合集(含答案) - 知乎 (zhihu.com)

自然语言生成综述 - 知乎 (zhihu.com)

自然语言中事件过程的理解/陈慕浩(USC),40页ppt - 知乎 (zhihu.com)

PyTorch 源码解读之分布式训练了解一下? - 知乎 (zhihu.com)

台大喊你来上课,深度学习优化,免费的哟 - 知乎 (zhihu.com)

ICML2021接受论文列表出炉! - 知乎 (zhihu.com)

21页NLP上的数据增广方法综述 - 知乎 (zhihu.com)

76页最全对话系统方向综述 - 知乎 (zhihu.com)

要学好GNN?看这份《图神经网络导论》176页干货教程,这份Bitdefender小姐姐讲解的教程通俗易懂! - 知乎 (zhihu.com)

Transformer | 详细解读Transformer怎样从零训练并超越ResNet? - 知乎 (zhihu.com)

面向Transformer模型的高效预训练方法 - 知乎 (zhihu.com)

最新!NLP顶会NAACL2021最佳论文出炉!罗切斯特-腾讯获最佳长论文 - 知乎 (zhihu.com)

小目标检测的一些问题,思路和方案 - 知乎 (zhihu.com)

最新综述:对话式检索数据集汇总 - 知乎 (zhihu.com)

首个面向NLP的图深度学习工具包问世! - 知乎 (zhihu.com)

一个小问题:深度学习模型如何处理大小可变的输入 - 知乎 (zhihu.com)

【NAACL2021】深度NLP模型的细粒度解释与因果性分析,附317页ppt与视频 - 知乎

MLP is Best? - 知乎 (zhihu.com)

NAACL2021 tutorial | 239页Deep Learning on Graphs for Natural Language Processing - 知乎 (zhihu.com)

复盘人生第一次科研经历 - 知乎 (zhihu.com)

ICLR2021 | 近期必读图神经网络精选论文 - 知乎 (zhihu.com)

AAAI 近20年最佳论文合集 - 知乎 (zhihu.com)

NAACL 2021 | 对比学习横扫文本聚类任务 - 知乎 (zhihu.com)

不可错过!CMU「概率图模型」课程,附Slides - 知乎 (zhihu.com)

ICCV 2021审稿结果出炉,有人已总结出了一份Rebuttal写作指南 - 知乎 (zhihu.com)

腾讯优图+厦门大学发布!2021十大人工智能趋势 - 知乎 (zhihu.com)

2021下半年会议论文投稿时间小结与历年接受率回顾(欢迎收藏) - 知乎 (zhihu.com)

赛尔笔记| 对话摘要简述 - 知乎 (zhihu.com)

PyTorch 常用代码段汇总 - 知乎 (zhihu.com)

Transformer长大了,它的兄弟姐妹们呢?(含Transformers超细节知识点) - 知乎 (zhihu.com)

Transformer Decoder-Only 模型批量生成 Trick - 知乎 (zhihu.com)

第十届全国社会媒体处理大会(SMP 2021) 技术评测方案 - 知乎 (zhihu.com)

首篇NLP图神经网络综述来了! 127页文档让你全面了解这个领域 - 知乎 (zhihu.com)

Transformer杀疯了!竟在图神经网络的ImageNet大赛中夺冠,力压DeepMind、百度...... - 知乎 (zhihu.com)

深度学习中的Attention总结 - 知乎 (zhihu.com)

【关于 AAAI 2021 之 情感分析论文串烧】那些你不知道的事 - 知乎 (zhihu.com)

ACL2021 main conference long papers list已出 - 知乎 (zhihu.com)

编辑于 2021-06-25 23:38