10 月 2019 | David 9的博客 --- 不怕"过拟合"

人类是一个神奇的物种，他们竟然可以把过往经验和自身感知叠加在一起进行“抽样”，他们管这种行为叫做：“灵感” — David 9

人对“时间”的感知似乎比其他动物都强，这也许导致我们对过往经历（或经验）的认识更加清晰。如果是神经网络的拥护者，可能会把类似RL增强学习“行为决策”的问题用类似“路径感知”的方法解释，即，我们的行为是对过往经历（经验）的感知后得出的。

无论这种直觉是否正确，发生在人类身上的“增强学习”有时还掺杂了许多自身其他复杂的感知：

有人说毕加索的创作灵感许多来自超空间感知（五维空间？）不可否认毕加索似乎是在用多只“眼睛”看世界，他的创作过程显然不是对经验“抽样”那么简单。

但对于纯AI领域的增强学习，更多是对经验“抽样”的艺术。之前David其实聊过策略学习的大体系（RL, IRL，DPL），今天，我们专注于讨论增强学习中的价值学习（Value Learning），这是透露RL底层逻辑的重要线索。

开启经验“抽样”旅程的第一步，是我们认识到除了IRL模仿学习，大多数增强学习，对于过往行为经验，都会给出回报（Reward）值。广义上任何行为都可以看做一种博弈游戏（game），而游戏的过程中总可以给出回报值（粗粒度或细粒度）。

以一个简单的路径游戏为例：

如果走到最右边的棕色悬崖扣一分-1，而如果走到蓝色框加两分（如左图+2分）。

如上图，现在摆在我们面前的看似只有两条实验路径（episode）。这是原始的蒙特卡罗法看到的抽样结果，这种抽样的偏见(bias)是明显的，它（智能体）今后会趋向选择“偏上”的路线，因为有一条+2的路线是靠上的。

如果“你所能告诉我的，只是你想表达的十分之一”，那么“表达”和接受“表达”的效率，也许是智能重要组成之一 — David 9

我们知道目前的AI无法表达自己，甚至，连接受“表达”的能力也相当有限。在NLP（自然语言）领域比其他领域更滞后。从word2vec词向量到ELMo，再到2018年谷歌的BERT系列模型，深度神经网络在NLP领域中“半推半就”达到一个有共识的高度：

即使经过这样一个漫长的过程，BERT系列模型还是需要在预定domain域上事先做大规模预训练，才能在下游任务上表现更好：

“大规模预训练”，“更宽深层双向encoding”，“带MASK的无监督训练”，“注意力机制”，“fine-tuned模型”，对BERT有一些深入了解的朋友一定对以上这些词不陌生。是的这些是BERT训练要素。

但是BERT有效，是因为在目前大数据和算力的条件下，不得已只能使用这种方式超越前任算法。这种方式的好处很明显：

1. 多头的注意力机制和双向encoding让BERT的无监督训练更有效，并且使得BERT可以构造更宽的深度模型：

2. 把特定任务的模型fine-tune放到后面去做，增大整个模型的灵活性。如果你能拿到较好的预训练模型，甚至再用一个简单的logistic回归就能fine-tune出一个较好的任务模型。

3. BERT无监督(自监督)的预训练，给了其他连续型数据问题很多想象力。所谓连续型数据问题，指那些像语言，音频，视频等（如果任意删除其中一段，在语义上就显得不连贯）。这种数据结合BERT模型可以做一些有意思事情，如VideoBERT, 就是通过把字幕和视频拼接，作为一个新的连续型BERT模型（用来自动生成字幕）：继续阅读回顾BERT优势与劣势：深入理解这些无监督怪兽，及其前景展望，GPT，BERT，VideoBERT