毫无疑问,最新的 XPrize 是迄今为止最奇怪的 XPrize。 它被称为TED 人工智能 XPrize,这个名字似乎说明了一切,但又不完全是。正如上周宣布的那样,这项比赛是“现代图灵测试,奖品是第一个在舞台上走上或滚上舞台并发表 TED 演讲的人工智能,演讲如此引人注目,以至于赢得观众的起立鼓掌。” 但实际奖项并未具体说明。所提出的规则只是比赛最终可能的样子,基于公众提交的想法。 然而,这句话的描述以及示例规则,让人对首届人工智能 XPrize 的有效性产生了疑问。机器发表的 TED 演讲与推动人工智能的发展有什么关系呢? 首先,这些示例规则。正如 XPrize 网站所述,“这个概念的元素可能会用到,也可能不会用到”,但细节仍然很有启发性。在提议的场景中,团队将提前获得 100 个讨论主题。其中一个主题将在 TED 会议上被选中(随机或由观众选择),然后人工智能将有 30 分钟的时间来提出 3 分钟的演讲。在 TED 演讲结束后,“观众将用掌声投票,如果合适,还会起立鼓掌。” 以往的 XPrize 竞赛都采用了完全基于经验的获胜条件——率先越过终点线,或者在两周内两次到达亚轨道高度。在这个虚构的例子中,集体分贝水平是否会将巨大的掌声推向礼堂天花板?如果两个机器人在同一次会议上获得起立鼓掌,情况会怎样?组织者会计算每次鼓掌的速度、发出的欢呼声或流下的眼泪吗? 虽然这些问题听起来有些可笑,但模糊的才艺表演机制与比赛的下一个阶段息息相关,而且这个阶段可能更具挑战性。 在观众评分的 TED 演讲结束后,人工智能必须回答《连线》杂志前主编、TED 大会策展人克里斯·安德森提出的两个问题。专家小组将“投票”。这可能是掌声对决的决胜局。或者也许每位专家的掌声都会放大二十倍? 可以这么说,AI XPrize 似乎不是由 AI 研究人员炮制出来的。样本规则表明 XPrize 的规则要宽松得多,更注重娱乐性,这是一种由真实研究支持的营销噱头。 除非研究人员只是假装。“我认为挑战的精神很酷,也很有用,”斯坦福大学认知科学家 Noah Goodman 说。“但就目前的情况来看,它很容易作弊。你可以找一群艺术家和知识分子,为这 100 个主题中的每一个编写一个脚本,然后在知道是哪个主题时播放正确的脚本。然后你就解决了第一部分,而根本不需要使用人工智能。” 问答环节不会那么容易被操纵,但到那时,起立鼓掌可能已经得到批准或被拒绝。这大致相当于为美国小姐加冕,然后问她地缘政治问题。 问答系统的目的在于提供一个独立的图灵测试,无论它最终如何构建,将经典、直接的人工智能研究元素与看似机器人的表演技巧相结合。图灵测试由计算机先驱艾伦·图灵于 1950 年首次提出,要求机器通过欺骗人类评委来证明其智能,通过一系列即兴的回答让他们相信它和他们一样是人类。 然而,图灵测试更像是科学史,而不是科学,这种方法已被绝大多数人工智能研究人员抛弃。每年,各团队都会争夺洛布纳奖,奖金将颁发给最像人类的聊天机器人。而且每年,除了比赛之外,没有人关心。“洛布纳奖很有趣,但在推动科学议程和吸引公众对人工智能的广泛兴趣方面,它完全失败了,”古德曼说。“图灵测试作为一个思想实验发挥了极其宝贵的作用。它不是一个可行的研究目标。” 在图灵测试的所有问题中,最大的问题之一与人类有关。评委经常被幽默搞晕——不是基于新信息的适应性、创造性的幽默,而是预先准备好的笑话,这些笑话会在有策略的间隔内释放,以避免必须设计更相关的回应。事实证明,人类并不是图灵测试的可靠仲裁者。“这次 XPrize 也会有同样的问题。任何看过很多 TED 视频的人都知道,他们的节奏非常引人注目,很容易辨认,风格平淡无奇,”古德曼说。“只要在笑话和特定的风格技巧中编程,就能获得相当多的好评。” 需要说明的是,古德曼对本次 XPrize 的批评并不像我那么严厉——他真的很期待看到组织者会拿出什么成果。赫特福德大学人工智能教授克斯廷·道滕哈恩则不那么热情。道滕哈恩说:“现在和未来机器人的主要挑战在于与世界的互动,而不是性能技巧。”道滕哈恩的工作涉及人工智能、人机互动和社交机器人。 对于 Dautenhahn 来说,人工智能机器人面临的主要挑战在于它们如何与无生命和社会环境互动——例如,如何在房间中穿行,以及如何进行对话。“我在 XPrize 中看不到这些元素,所以我不确定奖项规则涉及哪些有用的技能——在推动现实生活中的人工智能方面有用,”她说。 一旦实现,AI XPrize 完全有可能成为一项更有意义的研究,而不是一个滑稽的噱头。对于 Goodman 来说,这种转变可能很简单,只需迫使 AI 即兴发挥即可——这是人类智能的一个关键特征,也是机器的长期绊脚石。例如,不要介意 100 个主题集(一个需要预先录制的演示的框架)。相反,系统可以在现场随机获得一个主题,允许从互联网上汇编数据,然后进行演示。现在这是不可能的,”Goodman 说。“我可以想象 5 年后它会成为可能。” 我个人认为,AI XPrize 存在的问题比规则更大,尤其是与赞助商的关系。Progressive Automotive XPrize 并没有要求参赛团队制造保险费本来就很低的汽车。AI XPrize 以 TED 为中心,在 TED 场地上举行,其成功或失败将根据之前的 TED 演讲来衡量。不可否认这些会议的影响力以及 TED 机器人将获得的关注。但当你要求计算机科学家解决问题并赢得起立鼓掌时,这更像是狂欢表演而不是严肃的比赛。这是第一次,有可能赢得 XPrize 却不赢得任何人的尊重。 |
<<: 史上最雄心勃勃的 DNA 构建项目:科学家制造出人工酵母染色体
天文学家米斯蒂·本茨想让你知道,黑洞不会吸东西。“它们不是宇宙吸尘器,四处游荡,把一切都吸进去,”她...
我们中的许多人都认为触觉是理所当然的,也许是因为我们永远无法关闭它,但它却出奇地复杂。错综复杂的神经...
航空公司无法控制天气。他们只能退而求其次,尽可能准确地预测即将发生的危险,并提前规划航线中断。要做到...
今年 2 月,黑鹰直升机首次实现了无人驾驶飞行。这项自主飞行军用直升机项目由 DARPA 和西科斯基...
一颗轨道卫星完成了为期一年的任务,该卫星用于测试有朝一日收集太阳能并将其传输到地球的技术可行性,研究...
驯狮师正在工作。虽然没有证据,但这位留着小胡子的男子不太可能在这场戏中幸存下来。国会图书馆,1873...
大盐湖西南部的杜格威试验场被太阳炙烤着,美国陆军最近从一辆沙地车上发射了无人机。作为探索未来战争装备...
《Tekyu》第四季的魅力与评价《网球》是一部改编自 Roots 和 Piyo 的原著漫画的电视动画...
这一天已经到来,微软现在正式向大众推出 Windows 11。旧款机器的推出时间表仍不确定,但新款 ...
以下摘录自埃里卡·西琳所著的《血浓于水:寻求塑料危机的解决方案》 。癌症巷沿着密西西比河两岸蜿蜒 8...
《乱马½ DoCo Music Video》的魅力与评价介绍《乱马半 DoCo 音乐视频》是 19...
中国国家航天局 (CNSA) 成功登陆月球背面后,首批从月球背面拍摄的图像已发布。嫦娥四号着陆器和玉...
木材干燥后会收缩,收缩后就会开裂。不幸的是,如果你使用木材,最终你不得不处理裂缝。少量裂缝可以忽略不...
当我还是个孩子的时候,住在纽约州布法罗市,回父母家的路上会经过一家庞蒂亚克经销店,店里停着一辆红色的...
“龙买房。”诉求与评价“龙买房。” 《龙,买房记》是一部电视动画,于2021年4月4日至6月20日播...