学习模型

  • 核心思想:个体通过强化学习(凭自身经验)或社会学习(复制他人)调整行为。在博弈中,两种学习可能收敛到不同均衡。
  • 书里怎么解释的强化学习根据奖励是否超过“渴望水平”来调整权重,最终收敛到最优行动。复制者动态(社会学习)让高收益策略在人群中比例增加。在博弈中,强化学习倾向于绝对收益,社会学习倾向于相对收益
  • 书里的例子
    1. 油老虎车博弈:两个均衡(都开经济型车效率高,都开油老虎低效)。强化学习和社会学习都收敛到“油老虎车”(低效),因为当两种行动初始均等时,开油老虎平均收益2 > 开经济型平均收益1.5,所以风险主导均衡胜出。
    2. 慷慨/妒忌博弈:慷慨行动是占优策略(绝对收益高),但妒忌行动让相对收益更高。强化学习让人学会慷慨(因为尝到甜头),复制者动态让人学会妒忌(因为复制相对收益更高的行为)。所以“向他人学习”不一定比“自己摸索”更好。
    3. 文化压倒战略:CEO推行新战略,如果一开始支持者比例低于20%,文化(现状)就会压过激励。但强大的激励机制可以突破这个阈值。两个对立谚语“文化压倒战略”和“人对激励反应”都只在特定条件下成立。

启示

  1. 自己摸索(强化)能学会“绝对的好”,但向人看齐(社会)容易变“刻薄”。书中慷慨/妒忌博弈:自己试,学会了慷慨(绝对收益高);看别人,学会了妒忌(相对收益高)。普通人想培养好习惯,不要跟风别人卷,要自己记录每天的真实感受(写日记),找到对自己最有益的节奏
  2. 文化常常压过战略,除非激励极大。书中说,如果支持新方案的人少于20%,新战略会失败。你在单位想推行任何改革,即使道理全对,如果没拉拢到超过20%的“早期接受者”,大概率会被老文化吞噬。先搞定20%的人,再谈改变
  3. 渴望水平不要设太高。强化学习中,渴望水平如果高于所有选项的奖励,权重会归零。普通人育儿或自我要求,不要把目标设得遥不可及(比如年入百万),否则你做什么都觉得没回报,会彻底失去动力。把渴望调低到略高于现状,每一步都有反馈,才能持续进步。

类似文章