科技
AI安全研究员克里斯蒂亚诺将赴多伦多演讲
美国AI安全研究员保罗·克里斯蒂亚诺将于11月9日至11日在多伦多举行的第三届欣顿讲座发表演讲。作为RLHF技术的重要推动者,他警告当前是AI的“危险时刻”,并预测6到18个月内人类可能难以抗衡失控系统。
来源与引用规范链接 · 来源 · 更新时间公开可引用
- 发布机构
- 雪鸮新媒网
- 编辑 / 作者
- 陈一凡
- 内容类型
- 翻译
- 主要来源
- BetaKit
- 首次发布
- 最近更新

美国AI安全研究员保罗·克里斯蒂亚诺(Paul Christiano)下月将前往多伦多,讨论AI技术的未来,以及如何确保这项技术始终与人类利益保持一致。AI安全基金会(AI Safety Foundation)周一宣布,他获选为第三届欣顿讲座(The Hinton Lectures)的主讲人。欣顿讲座由图灵奖得主、诺贝尔奖得主杰弗里·欣顿(Geoffrey Hinton)联合创立,欣顿本人被称为AI“教父”之一。本届活动定于11月9日至11日举行。
RLHF指“基于人类反馈的强化学习”(reinforcement learning from human feedback),是一种后训练技术,目的是让AI系统与人类偏好对齐。克里斯蒂亚诺在OpenAI担任早期研究员期间,帮助引入了这一技术。欣顿在本次活动的开场发言中说,RLHF让今天公众使用的AI聊天机器人得以推出,并让OpenAI对谷歌取得了巨大优势。
活动前,克里斯蒂亚诺与BetaKit及其他媒体连线,谈论自己的工作、AI现状,以及他认为这项技术在不久的将来可能带来的生存性挑战。他说:“这是AI领域、乃至整个世界历史上一个极其重要的时刻。”
他回顾说,十年前这些系统还写不出一句通顺的话;而过去一个月里,AI系统在数学领域完成了相当于十年的进展,并展示出长期执行复杂现实计划的能力,其中还包括一系列黑客攻击,同时在用于衡量其性能的测试上已经顶到上限。这些因素,加上“我们并不擅长指挥自己创造的AI系统”,共同造就了“一个特别危险的时刻”。
他以OpenAI与Hugging Face的网络安全事件作为早期案例,称这类事件目前只造成了“非常小规模的伤害”。但如果把这类行为放大到训练于更广泛任务分布的强大AI系统上,“你可能会看到不可逆的伤害”。
考虑到当前AI的进展速度,以及AI可能自动化并加速AI研发过程,克里斯蒂亚诺说:“确实存在这样一种可能:在未来约6到18个月的时间尺度内,我们将面对这样的AI系统——如果它们想逃脱人类控制、削弱人类控制,或者公开与人类对抗,人类将很难取胜。”
他还预测,不久之后,AI开发过程中的很大一部分将“极难”被人类跟上,更不用说理解,人类将不得不依赖AI去测量和审查其他AI系统,而这一前提本身又带来额外风险。
克里斯蒂亚诺目前担任美国国家标准与技术研究院(NIST)AI标准与创新中心的高级技术顾问,同时是对齐研究中心(Alignment Research Center,ARC)的创始人兼执行主任,并在OpenAI基金会董事会和OpenAI安全与安全委员会任职。
他不认为RLHF是让这些系统变安全的终极答案。虽然它推动了生成式AI的重大突破,但他指出这项技术“极难规模化”,“大概会在某个时候失效”。各方正在为不断成长的AI探索不同的训练替代方案,但他说目前还不清楚哪种会成功、何时成功。ARC就是其中之一,他估计这家非营利组织的成功概率接近10%,而不是50%,并称其研究未来可能变得有用,但大概不会从根本上改变人类控制这项技术的能力。
除非政治层面的结果放慢AI的进展速度——欣顿和加拿大AI先驱约书亚·本吉奥(Yoshua Bengio)等人都在呼吁这样做,本吉奥当天还撰文呼吁,把安全置于首位的前沿AI公司员工应当离职——否则克里斯蒂亚诺怀疑,自己5到10年后不会再从事相关研究。
在他看来,就如何衡量这些系统的性能建立共识与标准将是关键。在有报道称一些公司限制美国以外地区访问某些模型之际,克里斯蒂亚诺认为这类问题“不能真的靠闭门磋商妥善解决”,最好由全球科学界来处理,从美国的研究人员到加拿大及海外的专家。
活动主办方提供的头图由AI安全基金会提供。



