迁移学习入门:把已有模型的知识迁移到新任务

训练一个深度学习模型通常需要大量标注数据与算力,而现实中很多任务标注稀少、预算有限。迁移学习(Transfer Learning)的思路是:先在一个数据充足、任务相关的源领域把模型训好(预训练),再把学到的「知识」迁移到目标领域的新任务上,从而用更少的样本与更低的成本达到可用效果。

预训练与微调范式

最常见也最成熟的范式是「预训练加微调」。先在大规模通用数据(如 ImageNet 图像、大规模文本语料)上训练一个基础模型,让它学到通用的底层特征表示;再在目标任务的小数据集上做有监督微调。

步骤一:在源领域大数据上预训练,得到通用基础模型。
步骤二:在目标领域小数据上微调,得到专用模型。

这一范式在 CV 与 NLP 都已被反复验证:在 ImageNet 上预训练的卷积网络,常作为下游检测、分割任务的起点;语言模型 BERT【已核验,arXiv:1810.04805】在海量文本上预训练后,只需在下游任务上微调即可取得很好效果。

特征复用与微调策略

微调的核心问题是如何复用已有特征、改多少。浅层通常学到边缘、纹理等通用特征,深层更贴近具体任务语义。常见策略有:

冻结部分层:只训练新增的顶层分类头,固定 backbone 参数,适合数据极少、怕过拟合的场景。

分层学习率:底层用更小的学习率(保留通用特征),顶层用更大的学习率(快速适配新任务)。ULMFiT【已核验,arXiv:1801.06146】提出的渐进解冻与分层学习率,是文本微调的经典做法。

# 伪代码:分层学习率(以 PyTorch 风格示意)
optimizer = AdamW([
    {"params": base_model.embed.parameters(), "lr": 1e-5},
    {"params": base_model.encoder.parameters(), "lr": 2e-5},
    {"params": head.parameters(), "lr": 1e-4},
])

领域自适应

当源领域与目标领域的数据分布不同(例如训练用合成图、部署用真实图),仅靠微调还不够,需要领域自适应(Domain Adaptation)。目标是缩小源域与目标域在特征空间上的分布差异,让同一模型在两者上都生效。

典型做法是领域对抗训练(DANN)【已核验,arXiv:1505.07818】:在特征提取器后接一个「领域判别器」,训练时让它分不清特征来自源域还是目标域,从而迫使特征变得领域无关。这属于无监督领域自适应,目标域无需标签。

Fine-tuning 与 Prompt-tuning 的区别

传统微调会更新模型全部或大部分参数,成本高,且需要为目标任务保存一份完整权重。Prompt-tuning 则冻结原模型,只在输入侧加入可训练的前缀或提示向量,用极少参数引导大模型完成新任务【已核验,arXiv:2104.08691】。这类参数高效方法也让大模型在少量示例(少样本)下快速适配成为可能。

二者取舍:微调通常上限更高、效果更稳,但存储与训练开销大;Prompt-tuning 参数高效、便于一个基座服务多个任务,但对超大模型与提示设计更敏感。LoRA【已核验,arXiv:2106.09685】等低秩适配方法则折中:只训练注入的低秩增量,兼顾效率与效果。

适用场景与局限

迁移学习适合:目标数据少、标注贵;源任务与目标任务相关;已有高质量预训练模型可用。

它的局限也要看清:源域与目标域差异过大时,迁移可能「负迁移」,反而拖累目标任务;预训练模型的偏见与缺陷会被一并带过去;领域自适应在源域完全无标签、或两域差异极端时效果有限。

小结

迁移学习把已经训好的模型知识复用到新任务,核心范式是预训练加微调,配合冻结层、分层学习率等策略控制改动力度;当两域分布不同,用领域自适应缩小差距。相比全参数微调,Prompt-tuning 与 LoRA 等参数高效方法用更少代价适配大模型。把握相关性与数据量是用好迁移学习的关键。

参考与延伸阅读

  • Pan, S. J., Yang, Q. A Survey on Transfer Learning. IEEE Transactions on Knowledge and Data Engineering, 2010. 迁移学习领域奠基性综述。已核验。
  • Devlin, J. 等. BERT: Pre-training of Deep Bidirectional Transformers. arXiv:1810.04805, 2018. 预训练加微调范式的代表工作。已核验。
  • Howard, J., Ruder, S. Universal Language Model Fine-tuning for Text Classification. arXiv:1801.06146, 2018. 提出渐进解冻与分层学习率。已核验。
  • Ganin, Y. 等. Domain-Adversarial Training of Neural Networks. arXiv:1505.07818, 2016. 领域对抗训练(DANN)原论文。已核验。
  • Lester, B. 等. The Power of Scale for Parameter-Efficient Prompt Tuning. arXiv:2104.08691, 2021. Prompt-tuning 方法。已核验。
  • Hu, E. 等. LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685, 2021. 低秩适配方法。已核验。