十几年前的夏天,中学生的夏令营。
外教拿出一盒糖果(是真的糖果),组织同学们玩一个游戏:合作还是背叛。

两个同学上来,每人先发10颗糖果,规则很简单:
如果两人同时喊出合作,每人得1颗糖果;
两人同时喊出背叛,都没有糖果;
如果一方合作、另一方背叛,背叛者直接从对方手里拿走2颗糖果。
每次匹配后连玩10把,看谁最后糖果多。
那天玩得很热闹,外教发了很多糖,结果我也记得,反正就是“傻白甜”选了好多次合作的都被骗得很惨,爱选背叛的带走了大把糖果。
仔细想一下你会发现,在一次游戏里,无论对手选什么,我们选择背叛一定比合作好,所以聪明的选择是永远背叛。

两个聪明人会一起背叛,最终谁也拿不到额外的糖;两个“傻子”反而能让糖果一起增加。这就是经典的囚徒困境。
囚徒困境有没有破局的方法
难道聪明人只能永远会被困住吗?囚徒困境有没有破局的方法?还真有。
真正困住聪明人的,是那个看得见的最后一轮。如果游戏明确只玩10轮,最后一轮没有未来可言,理性选择自然是背叛。既然第10轮必然背叛,第9轮也失去了维持合作的意义。沿着这个逻辑向前倒推,背叛会一路蔓延到第1轮。
那如果我们把那个看得见的最后一轮撤掉会怎么样?在一个永远会玩下去的“囚徒困境”里,聪明人可以采用的策略是:
如果对方一直合作,我就一直合作;
对方只要背叛一次,我以后永远背叛;
第一次先从合作开始。
两个采用这种策略的人相遇,他们就能永远合作,让各自的糖果都越来越多。
当然,更严谨一点来解这个囚徒困境的话:不需要实际无限次,只需要不存在一个双方确定知道的最后一轮,并且下一轮继续出现的概率足够高(Dal Bó,2005,Cooperation under the Shadow of the Future)。
继续细究会涉及数学,也不是本文的重点。现在我们只要知道:
同样的一场游戏,同样的两个绝顶聪明的人,玩1次/10次/任何数字的有限次,和玩无限次,最终呈现出的博弈策略会是不同的。
这和扑克有什么关系?
让我们来回顾下听别人讲GTO,或者更广泛一点,关于“平衡”的概念的时候,通常都会说:如果你过度弃牌,对手可以用任意两张牌诈唬你;如果你诈唬不足,对手可以过度弃牌,你的价值牌就得不到支付;如果你某个行动不平衡,对手迟早可以找到某个按钮并反复按下去,并狠狠剥削你的糖果。。。
这些关于平衡的表达暗示着你和对手会一直玩下去;GTO的求解过程本身近似无限次博弈(电脑上千万次互相剥削后几乎不再调整策略,便有了GTO)。

但来到真实世界中,当你过度弃牌的时候(除非你自己亮牌或者实在太离谱),对手能剥削到你的前提是:
真的在关注你,而不是同时在和朋友聊天、刷短视频、或者处理另外7张桌子;
认清不同场景/牌面,积累样本,然后区分真实倾向与短期波动;
有足够的理论水平做出正确的调整。
等到对手满足了以上3点,还需要你和对手都还留在桌上,没人鸽子,没人退游,没人升级。
承认吧,这很难的。如果你玩的是现场锦标赛、一年去几次线下常规桌、或者你玩线上牌局但不是同开多桌一天打6个小时以上的职业玩家,你和你遇到的99%的对手都只会擦肩而过,打完一手牌连互相道一声SB的机会都没有。更现实的情况是:
你在担心过度弃牌,但对面那个Nit一整晚都生不出一手像样的诈唬;
你拿Nuts保护好过牌范围,下一次你的中等牌还是在过牌之后被猛猛炮轰;
你做出一次GTO式成牌转诈唬撞上鱼玩家慢打的钢板,他转头拿着你送的买入连同他自己的,输光给其他人,破产下桌了。
有限次博弈不会让GTO失效
值得注意的是,不是说GTO在有限次博弈的设置下就不再成立。这里的有限和无限,改变的只是实战中“保持平衡”和“主动剥削”的相对价值。
保持平衡的价值体现在长期博弈中让自己无懈可击,等待对手主动犯错赠送EV;而主动剥削的价值则是快速把有限次博弈中眼前最该拿下的EV变现。
如果你学了GTO,学了关于平衡的知识,理论,策略,但牌桌上依然很难提升,有可能就是因为:你的学习和实战目标,在游戏的博弈性质上就错配了。
你在牌桌下学习GTO、牌桌上把主要精力花在构建自己的平衡策略,防止被对手剥削,而不是花在关注对手的策略偏离和调整能力并相应设计剥削策略,就是过度强调了长期博弈中价值更高的“保持平衡”,但忽略了有限次博弈中真正给你带来盈利的“主动剥削”。
所以下一次面对那个具体的对手时,别只想:“GTO会怎么做?”
而是再多问一句:我们还会打多少次同类场景,而他真的来得及学会惩罚我吗?
至于如何根据以上这个问题答案的“是”和“否”(或者介于中间的任何摸棱两可地带),建立一套可执行的扑克思维,下一篇我们继续聊。

