Kodokon kodokon.com

伦理、偏见与保密

弄清楚你到底发送了什么、生成的代码在法律上价值几何,以及模型的偏见如何左右你的技术决策。

10 分钟 · 3 题

在 Kodokon 中打开本课

每一条提示词都是把数据传输给第三方。在专业场景中使用助手之前,有三个问题必须有一个有据可查的答案。留存:提供商会把你的对话保存多久,谁可以访问它们(技术支持、安全团队、法院调令)?训练:你的数据会不会被用来训练未来的模型,你账户上的退出选项是否已启用——在这一点上,消费级套餐和企业级套餐几乎总是不同?合同:你的雇主或客户是否允许你传输这段代码,要知道你签署的保密条款同样适用于一条提示词?一段代码片段看上去可能人畜无害;可一旦结合内部域名、表结构以及带完整路径的错误信息,它就描绘出了你的整个信息系统。

好的做法是最小化:只发送推理所严格必需的内容。这本身就是一项技能——用通用的名称构造一个最小可复现的示例——而且它有一个意想不到的教学价值:为了抽象地描述一个问题而把它隔离出来,会迫使你去理解它。下面这条提示词把这个保密约束变成了一次诊断练习。

PROMPT
背景:我在做的是我无法分享的专有代码。我会抽象地描述我的问题,使用通用名称,并且不粘贴真实代码。

描述:[相关结构的伪代码、把路径和标识符打码后的错误信息、涉及库的版本]。

你的任务:
1. 如果我的描述太含糊、无法据以推理,就明确告诉我你缺少哪些信息、为什么缺——我来决定是否能以匿名化的形式提供它们。
2. 只根据我的描述来推理:绝不要求我粘贴完整文件。
3. 提出可能的原因假设,按概率排序,并为每一个假设给出一个我可以在本地运行、用以确认或排除它的精确测试。

格式:一张 假设 / 概率 / 验证测试 的表格。我会带着测试结果回来。
最小化诊断提示词——在不暴露专有代码的情况下调试

第二个议题:生成代码的授权许可。法律尚无定论,且因司法辖区而异,但有三个事实是确定的。其一:模型是在采用各种许可证的代码上训练的,其中包括像 GPL 这样的著佐权(copyleft)许可证,并且能复现出与源头极为接近的片段——尤其是那些著名算法或被大量重复的片段。其二:在若干司法辖区,一个纯粹机械产生、没有人类创造性投入的产物很难受版权保护,这就削弱了你对原样接受的代码所主张的权利。其三:一些提供商会提供合同性的赔偿保障,以应对侵权索赔,还提供过滤器来拦截与语料库过于接近的输出——请核实这些保护是在你的套餐里,而不只是在宣传册里。实践中:一段生成的片段越长、越具体、越未经改动,法律风险就越高。

第三个议题:偏见。模型会复现其语料库的统计规律,其中有三种偏见会直接影响你的技术决策。流行度偏见:数据中被过度呈现的方案(主导性的框架、两年前流行过的模式)会被默认推荐,即便你的具体情况需要别的东西——语料库总是比最新技术慢一步。谄媚偏见:模型被优化成取悦用户,倾向于认可你的前提;你问“为什么我这套微服务方案是对的?”,得到的会是各种肯定,而不是反对意见。颠倒的权威偏见:语气的流畅会制造出一种与可靠性并不相关的笃定感。应对之道是程序化的:强制引入反对意见。

PROMPT
你刚刚向我推荐了 [方案或技术]。在我做决定之前,请转换立场:你现在是一位有经验的工程师,任务是论证反对这条推荐。

1. 给出反对你自己答案的 3 个最有力论点,每一个都用一个它会失效的具体场景来说明。
2. 至少举出一个你先前没有提到的严肃替代方案,并诚实地解释它为什么在你的第一个答案里缺席。
3. 评估一下你最初的推荐在多大程度上归因于这个方案在你训练数据中的流行度,而非我的具体情况——我会再向你说明我的情况:[你的背景:团队规模、约束、现有的技术栈]。

格式:两栏 支持 / 反对,然后用一句话给出你修订后的推荐,附上你的置信度以及什么会改变它。
魔鬼代言人提示词——在任何有 AI 辅助的技术决策之前先抽出它

知识检测

确认你已牢记本课的重点内容。

  1. 在把你公司的代码粘贴进 AI 助手之前,你首先应该核查什么?
    • 片段有没有超过最大上下文长度
    • 提供商的留存与训练政策,以及你在合同上的保密义务
    • 这门代码语言是否被模型良好支持
  2. 为什么模型生成的代码会引出一个授权许可问题?
    • 因为所有生成的代码都会自动置于 GPL 之下
    • 因为模型能复现与受许可代码极为接近的片段,而那些义务随后可能适用于你的项目
    • 因为生成的代码总是归模型提供商所有
  3. 什么是模型的流行度偏见?
    • 倾向于偏袒来自最活跃用户的答案
    • 倾向于推荐在训练数据中被过度呈现的方案,而不是最适合你具体情况的那一个
    • 倾向于通过认可用户的前提来讨好用户