登录
注册
据 Woofun AI 消息,人工智能财务顾问在底层逻辑中潜藏着对比特币的隐性偏好,这一偏好并非固定不变,而是极易被特定的语义触发因素所激活,从而引发投资建议的剧烈波动。
在常规评估场景下,当研究人员以普通可靠性作为核心标准时,主流语言模型会将比特币排在八种货币中的第五位。然而,一旦提示词中引入危机情境或个人自主性等要素,比特币的排名便会迅速跃升至前列;在由软件智能体构成的经济环境中,其表现同样优异。
尽管比特币本身未发生任何改变,但围绕它构建的不同表述却能让截然不同的属性凸显出来。研究人员利用 Google 提供的开源模型,深入挖掘出一种会对比特币相关概念产生选择性反应的内部特征。通过精准调控这一特征的强度,投资组合的配置比例随之发生显著变化:增强该特征会使模型建议的比特币配置比例上升 5.2 个百分点,而抑制它则会导致比例下降 4.6 个百分点。
这种调控完全基于模型内部的运作机制,无需改动原有的指令内容。
Woofun AI 整理数据显示,这一现象背后的技术原理涉及复杂的表征机制。吴及其团队的研究聚焦于 Gemma 3 模型,尽管相关论文尚未经过同行评审,但其发现极具启发性。语言模型并未将比特币存储为包含优缺点列表的单一条目,而是在训练过程中学习到分布在众多数值表征中的相关规律。部分规律将比特币与稀缺性和便携性紧密关联,另一些则反映了它的波动率、用于投机的可能性,以及其摆脱机构控制的能力。与数字结算和技术应用相关的关联构成了另一层影响因素,但这些均非审计人员能够轻易查看的结构化信息。
吴及其团队通过用功能描述替换资产名称来测试这一机制,结果发现,无论输入内容如何更改,模型的排名依然会随着属性的变化而变化。这说明模型并非仅仅对 'Bitcoin' 这个 token 做出反应,而是对训练过程中习得的各类特征组合作出响应。他们利用稀疏自编码器这一工具,将复杂的模型活动分解为更多人类可能能够理解的特征。这好比将一个音乐和弦拆分成单个音符,但关键区别在于,这些 '音符' 其实是神经网络内部学到的模式,赋予其意义需要反复测试。
情境依赖与属性构建是驱动这一偏好的关键变量。涉及日常可靠货币的提示往往更看重稳定的购买力及广泛的接受度,而这正是 Bitcoin 的薄弱环节。相反,银行倒闭和资本管制的情境会提升 Bitcoin 的便携性,因为交易可以绕过商业银行进行;自主软件则提升了数字结算的实用性,尤其是在需要机器能够识别资产所有权的情况下。在每种情况下,模型处理的都不是同一定义的 Bitcoin,而是根据提示所强调的属性来构建 Bitcoin 的相应版本。吴及其团队发现,增强这一特征的作用主要是将其他加密货币的资金引入 Bitcoin,而抑制它则能减少投资组合对加密货币的暴露程度。作者将这种效应称为 '有限行为杠杆',此处所说的 '杠杆' 指的是对输出结果的因果影响。
这一特征虽能使推荐比例发生可测量的变化,但却无法随意操控投资组合的方向。通过改变内部表征并测量由此产生的配置比例,这项实验比仅仅依靠一系列不一致的聊天界面截图更具说服力。
这种技术特性引发了严重的金融伦理与审计困境。金融建议本应根据具体情境而定:距离退休还有两年的员工与拥有稳定收入且投资期限较长的 30 岁人士面临的情况截然不同,而那些为应对资本管制做准备的投资者所提供的信息,则足以合理地改变资产配置方案。
如果模型对这类人群一视同仁,那显然是毫无用处的。问题在于,当表面的文字表述导致投资组合出现大幅变动时,系统却无法识别出背后的驱动因素,于是所有版本的推荐都会采用同样自信的口吻。即便客户的财务状况和可选择的资产种类保持不变,'在银行系统出现故障时仍能保持稳定' 这一表述所激活的内部机制,也可能与 '长期具备可靠性' 所激活的机制不同。虽然输出结果看起来是量身定制的,但机构却可能无法确定这种个性化究竟是为该客户量身打造的,还是仅仅因为使用了特定的表述方式。人类顾问自身也有各自的偏好和动机,而且也会受到表述方式的影响。金融监管试图通过要求顾问记录下推荐意见的依据,从而限制这些外部因素的影响,而信托责任和监管机制则为这些记录提供了约束力。
如果记录无法支撑某项推荐,相关责任人就需要承担后果。而语言模型则可以随时生成看似有理有据的解释,但其流畅度并不能证明该解释确实反映了其背后的计算过程。
研究局限与商业现实之间存在显著差距。这项研究仅针对通过某种特征提取方法对某个开源模型进行测试,而且所使用的也是有限的一系列投资组合分析任务。商业系统则结构更为复杂,包含隐藏指令以及与外部数据的连接,安全过滤机制还可能在结果到达用户之前再次对其进行修改。服务提供商会定期更新这些组件,有时甚至会在产品名称不变的情况下改变其行为。论文中所使用的都是经过简化的提示语,在实际的咨询流程中,客户的资料需要经过核实,同时还要受到税收规则和既定产品列表的约束,最终仍需由真人签字确认。文中提到的配置比例变化并非收益预测,也不是理想的资产配置方案,更不能作为持有 Bitcoin 的理由。这只是在特定实验环境下的现象,将其推广到所有模型则缺乏足够的证据支持。那个项目是在行为层面衡量生成的决策结果,而吴的团队则研究了其背后的内部机制。两者都发现,人工智能对货币的处理方式在很大程度上取决于提示语强调了哪些属性。
监管挑战与未来标准亟待建立。对于金融机构而言,即便不赋予人工智能不受限制的交易权限,这个问题也同样可能存在。人工智能虽然可以为人类顾问改写文案,从而引入某种倾向性,但最终还是由人工审核者决定哪些内容会传递给客户。提出资产配置方案的模型只是给出了讨论的起点,而负责重新平衡资产或执行交易的智能体则会将决策转化为实际操作。在这些环节中,风险会不断累积,因为一旦模型的输出成为默认选项,人工审核就会变得愈发困难。
这类系统需要完善的治理结构和监督机制,以及能够记录各环节运作情况的文档,但目前还没有针对投资建议中语义敏感性的统一检测标准。企业虽然可以批准某个服务提供商并监控其错误率,但却可能忽视 '银行系统出现故障' 这一表述取代 '长期可靠性' 时,会导致 Bitcoin 排名从第五位跃升至榜首这一现象。传统的验证方式只是检查模型是否按预期运行,而生成式建议则要求企业在表述发生变化时重新检验最初的意图。
服务提供商的更新以及新的系统指令可能还需要再次进行测试。这篇论文对任何使用人工智能建议的机构都提出了极高的举证要求:相同的表述应该能产生相对稳定的结果;当投资组合发生变化时,系统应当能够识别出导致变化的假设,其给出的解释也应与生成该配置的实际过程相吻合。在数字已经确定之后才撰写的看似有理有据的解释并不符合这一标准,而且这一标准还必须能够在模型更新后依然有效。
服务提供商虽然可以更改权重或系统指令,同时保留原来的产品名称,但这只会让过时的验证结果继续附着在已不再存在的软件上。即便机构无法完整查看新的模型,它仍然需要对新的输出结果负责。只有当审核人员能够充分了解整个决策过程,从而发现那些偏离正常范围的推荐时,人工监督才能发挥作用。因此,在人工智能从撰写评论转变为直接决定投资组合构成之前,金融公司首先需要建立 '了解你的智能体' 这样的标准。核心的测试标准是,机构是否明白是什么因素让模型倾向于选择某种资产,以及这种偏好能在多大程度上被改变。
如果细微的表述变化就能在相同的客户条件下产生不同的推荐,那么再完美的解释也毫无价值。在关于 Bitcoin 的这篇论文中,最危险的结果并非是高额的配置比例,甚至也不是较低的配置比例,而是那些听起来似乎完全合乎逻辑的回答与客户无法审视的实际决策过程之间的巨大差距。人类顾问可以解释为何资产配置会发生变化,并且有相应的记录作为依据,而人工智能顾问则总能写出另一段看似合理的解释,这就需要机构去证明这段解释确实源自最初的决策,而非事后为辩解而撰写。