
编者按:在人工智能飞速发展的今天,大型语言模型(LLM)如同神秘的黑箱,其决策过程往往令人费解。从政治倾向的微妙偏差到事实性幻觉的频发,开发者与用户都在追问:AI究竟为何如此思考?旧金山初创公司Guide Labs给出了一个突破性答案——他们开源了Steerling-8B模型,其全新架构让每一个输出都能追溯到训练数据的源头。这不仅意味着我们可以精准核查模型引用的依据,更能深入理解它对幽默、性别等复杂概念的编码方式。在AI日益渗透关键领域的当下,这种“可解释性”或许正是打开黑箱、建立信任的关键钥匙。以下带来详细解读:
驯服深度学习模型的挑战,往往在于理解它为何如此行事:无论是xAI反复调整Grok怪异政治立场的艰难尝试,还是ChatGPT的阿谀奉承倾向,抑或是司空见惯的幻觉问题,想要剖析一个拥有数十亿参数的神经网络绝非易事。
如今,由CEO朱利叶斯·阿德巴约和首席科学官阿雅·阿卜杜勒萨拉姆·伊斯梅尔创立的旧金山初创公司Guide Labs,为这一问题提供了解决方案。本周一,该公司开源了一个80亿参数的大型语言模型Steerling-8B,其采用了一种全新架构设计,旨在让模型的行为变得易于解释:模型生成的每一个标记(token)都能追溯至其在训练数据中的起源。
这既可以简单到确定模型所引用事实的参考来源,也可以复杂到理解模型对幽默或性别的认知方式。
“如果我有一万亿种编码性别的方式,并且我在这一万亿个事物中编码了十亿个,你就必须确保能找到我编码的所有那十亿个事物,然后你还需要能够可靠地开启或关闭它们,”阿德巴约告诉TechCrunch。“用现有模型也能做到,但非常脆弱……这有点像圣杯级别的问题之一。”
阿德巴约在麻省理工学院攻读博士学位期间开始了这项工作,他曾合著一篇被广泛引用的2018年论文,该论文表明当时理解深度学习模型的现有方法并不可靠。这项工作最终催生了一种构建大型语言模型的新方法:开发者在模型中插入一个概念层,将数据分门别类归入可追溯的类别中。这需要更多的前期数据标注工作,但通过借助其他AI模型的帮助,他们得以训练出这个模型,作为迄今为止最大的概念验证。
“人们目前所做的可解释性研究……就像是对模型进行神经科学分析,而我们颠覆了这种做法,”阿德巴约说。“我们所做的实际上是从头开始设计模型,这样你就不需要再进行神经科学式的剖析了。”
这种方法的一个潜在担忧是,它可能会消除一些让大型语言模型如此引人入胜的涌现行为:即模型对其未经训练的事物进行新颖概括的能力。阿德巴约表示,这种现象在他们公司的模型中仍然存在:他的团队会追踪他们称之为“已发现概念”的内容,这些是模型自行发现的概念,例如量子计算。
阿德巴约认为,这种可解释的架构将成为人人所需的东西。对于面向消费者的大型语言模型,这些技术应能让模型构建者做到诸如屏蔽受版权保护材料的使用,或更好地控制涉及暴力或药物滥用等主题的输出。受监管的行业将需要更可控的大型语言模型——例如在金融领域,评估贷款申请人的模型需要考虑财务记录等因素,但不能考虑种族。科学研究也需要可解释性,这是Guide Labs已开发技术的另一个领域。蛋白质折叠一直是深度学习模型的一大成功案例,但科学家们需要更深入地了解他们的软件为何能找出有希望的组合。
“这个模型证明,训练可解释模型不再是一种科学探索;它现在是一个工程问题,”阿德巴约说。“我们弄清了其中的科学原理,并且能够将其规模化。没有理由认为这类模型的性能无法媲美前沿水平模型(后者通常拥有更多参数)。”
Guide Labs表示,得益于其新颖的架构,Steerling-8B能够达到现有模型90%的能力,但使用的训练数据更少。这家从Y Combinator孵化出来、并于2024年11月从Initialized Capital筹集了900万美元种子轮资金的公司,下一步计划是构建一个更大的模型,并开始向用户提供API和智能体访问服务。
“我们目前训练模型的方式超级原始,因此,普及内在可解释性实际上将对我们人类自身角色产生长远的积极影响,”阿德巴约告诉TechCrunch。“当我们追求这些即将变得超级智能的模型时,你不会希望某个对你来说有点神秘的东西在代表你做出决策。”











