新闻里隔一阵就冒出一句"某 AI 通过了图灵测试",听着像机器人拿了毕业证。其实这个测试的场面特别朴素,用一句大白话就能说清:一个人当评委,看不见也听不见对方,只能靠打字问答;他同时聊两个窗口,一个窗口后面是真人,另一个是机器;聊完让评委猜哪个是人——猜不出来,机器就算赢。
举个完整的例子。在一个假设的测试里,评委面前开着两个聊天窗口,A窗口后面是一个聊天机器人,B窗口后面是真人小王。评委可以随意提问:今天天气怎么样、你小时候最怕什么、133 乘 7 等于多少、给我妈写句生日祝福。聊了 5 分钟、来回几十句之后,评委写下结论:"A 是人。"结果猜反了——A 才是机器人。这一轮机器成功被误认为人;一项完整测试是否算通过,还得看多轮结果和事先约定的规则。注意评委从头到尾没见过对方的脸、没听过声音,唯一的判断依据就是那一屏文字。
隔着文字,猜哪个是人
- 01评委
只通过文字问答
- 02两位对话者
一人一机,身份暂时隐藏
一次猜错只是一次结果;完整实验须看规则和统计。
这个游戏是谁发明的,为什么要这么玩
发明它的是英国数学家图灵。1950 年他在论文《计算机器与智能》里遇到一个难题:人人都在争论"机器能思考吗",可"思考"这个词谁也定义不清,吵一百年也吵不完。图灵干脆换个玩法:别纠结定义了,咱们做个能动手操作的游戏——机器只要在对话里装人装得足够像,让人分不出来,那再争论它"算不算思考"就没多大意思了。所以图灵测试本质上是一个"绕开哲学争论的操作标准":不测机器心里想什么,只测它表现出的对话能力。
原始规则里还有两个细节值得知道。一是评委和双方不见面、不通话,全靠文字——因为图灵要测的是"对话像不像人",不是"长得像不像人",把外貌、声音这些干扰项全部剔除。二是图灵当年是从一个"猜男女"的聚会游戏改过来的:原版里评委要隔着帘子猜一男一女谁是男的,图灵把其中一方换成机器,就成了今天说的图灵测试。
通过了测试,机器到底会了什么
1. 会"接话",不等于会"理解"。 测试只看聊出来的文字像不像人说的。机器完全可以靠话术过关:答不上来就反问、就诉苦、就转移话题——这些招数学说话的小孩都会,不需要真懂你在问什么。早在 1966 年,一个叫 ELIZA 的程序就靠极简单的套路冒充心理医生:你说"我难过",它就回"你为什么觉得难过"。结果不少人聊得挺投入,连发明它的魏岑鲍姆自己都吓了一跳——人太容易把"像人的回应"脑补成"真的理解"。
2. 评委是人,而人会松、会偏、会替机器找补。 2014 年一个叫"尤金·古斯特曼"的聊天程序号称首次通过图灵测试,让 33% 的评委在 5 分钟对话后认为它是真人。但它给自己安排的"人设"是一个 13 岁的乌克兰男孩——英语说不利索、问题答得幼稚,全都能用人设圆过去。很多研究者不认这个结果,道理就在这:测试的松紧全看规则怎么定、评委怎么想,赢一场这样的游戏,和"机器有了人的智能"中间还隔着十万八千里。
3. 所以图灵测试测的是一种很窄的本事:文字对话里的伪装能力。 它测不出机器懂不懂、有没有意识、可不可靠,甚至测不出它聪不聪明——一台机器可能在下棋、预测蛋白质结构上远超人类,聊天却三句露馅;反过来,一个只会聊天的程序也可能混过测试。如今的大语言模型聊天能力突飞猛进,混过短时间的图灵测试已经不新鲜,可它们照样会一本正经地编错话,这正说明"聊得像人"和"真懂"是两回事。
两个常见误会
误会一:通过了图灵测试,就说明机器有了意识。 这是把"像人"当成了"是人"。图灵测试从设计上就只管外部表现——隔着屏幕的文字,管不到机器内部发生了什么,更没有仪器能测"意识"。一台机器通过测试,只能说明它在这场对话里骗过了这几位评委,其余一概说明不了。
误会二:图灵测试是 AI 界的官方考试,"通过"就是权威认证。 它没有一个统一的主办方,没有标准考场,也不发证书。谁都可以自己攒一场:评委几个人、聊几分钟、允许多少闲聊,规则全由组织者定,宽松和严格的结果天差地别。所以下次再看到"某 AI 通过了图灵测试",先问三个问题:谁办的?规则多严?评委里有多少人被骗过?问完你就知道这条新闻的分量了。