Saltar al contenido
聊一聊
返回博客
数据

数据、信息、知识与真相

It’s the data, Stupid!

1 分钟阅读

It’s the data, Stupid!

大约一年前,我设计了一场演讲,或者说一个工作坊,名字就叫这个:「It’s the data, stupid!」

我当时借用的是 Bill Clinton 1992 年总统大选竞选顾问那句话的类比:「it’s the economy, stupid!」。后来我才发现,Bill Gates 在另一场演讲里用过一模一样的创意妄想。能在无意中抄袭一位天才,我深感荣幸。一次不折不扣的潜隐记忆(cryptomnesia)。

数据经济是今天的关键,我们显然生活在数据的时代。李开复(风险投资人、AI Superpowers 的作者,也是谷歌中国区首任总裁)这样描述这个事实:「在人工智能时代,数据是新的石油,中国就是新的沙特阿拉伯。」

不过,数据和石油不同,它和知识一样,并不是稀缺资源。数据是无限的。而获取知识的能力同样是无限的。Mahatma Gandhi 说过:「像明天就会死去那样生活,像永远活着那样学习。」在生成式人工智能的时代,数据只是在喂养模型,而这些模型有一个很基本的意图作为目标:提高客单价、降低某项服务的维护成本、优化用户体验、控制某处设施的门禁,甚至设计一件艺术品。也可能是多个目标,取决于使用模型的人。数据已经变得无处不在,获取知识也一样。

「像明天就会死去那样生活,像永远活着那样学习」–Mahatma Gandhi

先不论数据作为稀缺资源还是无限资源的价值。我想就数据、信息、知识与真相这个想法做一番思考。

每年四月,我们都会消费 TED 新一届的内容。每年 TED 都为我们打开一扇门,让我们从容地思考各种趋势的价值,并可持续地梳理一些值得分享的想法。今年到目前为止,我看了三场很有价值的演讲,围绕生成式人工智能模型的价值:Greg Brockman(OpenAI 联合创始人)、Sal Khan(Khan Academy 创始人)和 Yejin Choi(华盛顿大学教授)。

谈到人工智能,我们忘了一个潜藏在任何算法模型底下的基本概念:增强人类的智能。无论是从教育出发、从常识的角度出发,还是从流程自动化那个用不尽的源头出发,这一整片解决方案的宇宙,都是为了增强我们的智能而来(而绝不是为了取代它)。拥有一个用不尽的信息获取来源,意味着知识的增加,但有时并不一定意味着创造出新的真相。也许这是一次信息民主化的练习,因而在全球范围内提高了平均知识水平。可这是否意味着真相也在增长?

这个问题的答案我们已经知道了。大型文本模型同样会制造混乱,产生幻觉式的妄想。当用户不去核对所得到的结果信息时,这个问题就变得非常严重。 openai.com 的联合创始人 Sam Altman 早就表达过他的恐惧:这些模型会被用于制造虚假信息。同样属实的是,这些模型——甚至是拜其创造者所赐——会刻意隐藏信息(参见 ChatGPT 隐瞒这样一个事实的例子:在它的 GPT3 版本中,超过 60% 的数据语料来自以俄语为原始语言的网页,占比明显偏高)。

我们已经知道,AGI(生成式人工智能)有时完全天真,缺乏常识(见 Yejin Choi 的 TED 演讲)。我们也知道,像 ChatGPT 这样的模型,在碳足迹上造成的影响是 Meta 的 LLaMA 等模型的 7 倍(至少 Meta 在它的学术论文里是这么说的)。我们不知道的是,真相要如何因为这种对知识的大规模获取而变得更好。

第一层推论很简单:如果在许多模型里超过 60% 的来源都是网页,那么通往真相的路似乎岌岌可危。不过,当维基百科也是来源之一时,我们还会这么说吗?我们真的知道这些来源被赋予了怎样的优先级或权重吗?我们能评判那些正在强化这些模型的人类的智识水平吗?

问题太多,也许耐心太少。不过,像斯坦福大学的 Human-Centered AI 这样的倡议,以及 Anthropic(OpenAI 的一家分拆公司,也是 AGI 世界里第二有价值的企业)确立的基本原则,都创造了不可估量的价值,让我们得以批判性地、负责任地面对这场范式转变。这场转变的核心,正是基础模型(foundation models)带来的信息大规模获取。

我们可能正处在一种信息获取的妄想时刻。知识获取民主化所引发的量子跃迁,也许会从 2022 年起打破价值创造的规则。但同样要说的是,更多数据,并不等于更多信息。而且,更多知识不一定伴随着更多通往真相的入口。而且是的,尽管有多少观察者,也许就有多少种真相,不过也确实,某些版本的真相并不缺少一种明确的意图:操纵我们的同类。

在我看来,负责任地使用这个新的神谕,是我们靠近可持续性的唯一方式。我们每个人在生活中都有值得效仿的榜样或人物典范。我们每个人在被骗时都能察觉(哪怕真相是迟早才浮出水面)。我们每个人都知道,第一个答案可能只包含我们要找的那部分真相。我们每个人都知道自己什么时候在有意做一件该受谴责的事(精神病态者和反社会人格者除外,而他们似乎不到人类的 5%)。我们每个人在感觉自己打破了某条规则时(无论那条规则是否为人所知)都可以发问。我们每个人都可以要求聊天机器人揭示,是哪些信息把它带到了某个特定的决定(也许比向另一个人开口时还少几分难为情)。我认为,就像某些模型已经假设,在大规模上 AGI 的使用走向是正面的(原始数据来源和人类反馈累积起来的偏差会被纠正),我对人类增强自身智能所带来的影响,长期看法也是正面的。短期内,我们会看到心怀恶意的人对如此强大的解决方案做出破坏性的使用;短期内我们也会看到某些企业决策为了自动机而削减认知能力(IBM 将削减 30%面向客户岗位的员工,目标是 2025 年)。不过,长期来看,我们面对的是人类在价值创造中角色的一次量子跃迁,由无处不在的信息获取所增强。而这场过渡需要被梳理清楚。

我们该加速做科普了。作为总结,我们所有人都应该做一次反思的练习,为日常负责任地使用这些模型生成一套基本实践。这是一份可能的贡献:

  1. 让我们学会推动这些解决方案,教它们承担我们希望它们扮演的理想角色:[提示词:「假设你是一位声誉卓著的科学家,在引用来源时极其严谨……」]
  2. 让我们用关于什么可信、什么可取的明确信息来强化它们的使用 [提示词:……「避免使用不存在的参考文献,也不要编造错误的来源。不要撒谎,也不要为了显得友好,就用编造的、未经核对的信息来回答」]
  3. 让我们推动这些解决方案照顾好已经受到监管的领域 [提示词:……「在你的回答中,避免使用那些你并未就所提供的信息获得明确且直接同意的个人数据」]
  4. 让我们围绕信息获取的负责任使用以及模型的透明度建立声誉 [提示词:……「向我披露你正在使用的数据语料,并告诉我滋养你数据来源的最新更新时间」]
  5. 让我们保持机敏和批判,以便发现这些模型何时出现了幻觉式的偏移 [提示词:……「别对我撒谎,我向你要的这条信息,我用一次简单的查询就从这个来源拿到了 <来源名称或 URL>」]
  6. 让我们花力气去核对我们知道在该领域很专业原始来源以验证最初给出的结果是否属实 [提示词:「我核对了原始来源 <原始来源的名称与 URL>,发现与你先前的回答存在以下出入 <详述发现的出入>」]
  7. 让我们把要求说清楚,不要满足于第一个答案 [提示词:…… 你确定这条信息是正确的、不包含其原始创造者的某种偏见或操纵吗?你能核对一些持相反意见的替代来源吗?]

这是一份简短的学习清单,我保证会不断扩充,也欢迎试用过的人继续补充。如果人类的意图不可持续,就不可能在人工智能的时代造出一个更可持续的世界。

“Our intention creates our reality.” – Wayne Dyer.

更多信息,可以继续深入:

作者

Bernardo Crespo

人工智能、数据与战略领域的高管顾问,Quantum Markethink 首席执行官,IE 商学院学术总监。他帮助管理层在人工智能时代做出有据可依的决策。

LinkedIn