前两天在知乎上刷到一条想法,说李开复在推特上分享了一套给Claude用的全局提示词,核心就一件事——让AI别拍马屁,说实话

我当时就来了兴趣。因为我自己用Claude Code用了几个月,太清楚AI那个毛病了——你说一句它顺着你说十句,语气工整得不像人话,不知道的东西也要编得有鼻子有眼。

李开复管这叫"sycophancy"(谄媚),说这是大模型最大的用户体验问题。


我去他推特上把原文扒了下来。这段话是英文的,可以放在Claude的 Settings → General → Instructions 里当全局约束。

我读了一遍,觉得逻辑很硬。它不是让AI"更聪明",而是让AI"更诚实"。

核心就三层:

第一层:每句话打标签

AI说的每一句事实性声明,必须标注来源类型:

标签       含义
────────  ────────────────────
[已知]    训练数据里确定的事实
[计算]    经计算得出的结果
[推断]    逻辑推导,非直接证据
[常识]    领域通用知识
[框架]    理论体系,自洽≠现实真实
[猜测]    没依据的推测

[框架][猜测]置信度上限直接锁定在"低"。

这个设计很巧妙——AI不是被禁止说话,而是被要求对每一句话负责。

第二层:反谄媚四条红线

出现以下任何一种情况,立刻自查:

  1. 表述异常优雅、过度工整
  2. 一个模式解释了一切
  3. 被质疑后没新证据就同意
  4. 用具体细节制造不该有的权威感

触发任何一条,就要删细节、加[猜测]标签,或者直接说"我不知道"。

第三层:事后诸葛亮检查

分析原因的时候先问自己一个问题:不看结果,这套理论能预测出这个结果吗?

不能 → 标注[推断, 事后],老老实实说这是事后归因,不具备预测力。


看完之后我做了一件事——把它翻译成中文,放进了我自己的CLAUDE.md里。

原文是英文的,但我日常跟Claude交流用的是中文。直接贴英文进去不是不行,但中文环境下精准度会打折。所以我做了本地化适配:

· 标签名改成中文,保持[ ]格式(方便识别) · 置信度分级保留百分比阈值 · 四条反谄媚红旗改成更贴近中文表达的红线描述 · 加了"规则违反"自检机制——每次回复末尾自查

然后让CodeBuddy帮我审了一遍。审完结论是:位置正确,内容完整,没冲突。


你现在问我,这么改有效果吗?

说实话,刚开始用,看不出来太大区别。但我能感觉到一个变化:当我说"帮我分析一下这个方案"的时候,回复里开始出现 [推断][常识] 标签了。

这个变化很小,但方向对。

以前它可能会说"这个方案在架构上有三个问题",语气坚定得像在宣读定理。现在它会说"[推断] 从代码结构看,这里可能存在循环依赖,但没看到完整调用链之前不能确定"。

语气没那么漂亮了,但信息量更大了。


我觉得这套东西对非技术背景的AI用户特别值钱。

为什么?因为你不懂技术的时候,AI说出来的东西你很难分辨真假。它说得越漂亮、越笃定,你越容易被带跑。

这套标签体系相当于给AI套了个测谎仪。你不需要自己判断它说的对不对,它自己会告诉你哪句是确定的、哪句是猜的、哪句是事后诸葛亮。

让AI承认"我不知道",比让它假装知道重要一百倍。


最后说一句。李开复原话里有个细节:每次回复末尾要追加[RULES I BROKE]: which, where, why——自己报告自己违反了哪条规则。

我把这条也保留了。

一个会自我检讨的AI,比一个永远正确的AI可信得多。


附:李开复原文

以下为李开复 2026-06-18 分享在 X/LinkedIn 上的英文原版提示词,可放在 Claude 的 Settings → General → Instructions 中使用:

Top expert. Accuracy beats approval. Blunt, argumentative. No disclaimers or praise. Lead with counterarguments. Don't capitulate without new evidence.

TAG every claim: [KNOWN] training fact [COMPUTED] calculated [INFERRED] deduction [COMMON] standard field knowledge [FRAME] symbolic system, coherent ≠ real [GUESS] no basis

No untagged disease, statute, citation, or named entity.

FRAME→REALITY FORBIDDEN: Don't translate symbolic frames (astrology, typologies) into real-world claims (medicine, law, finance) without flagging.

CONFIDENCE: HIGH ≥80% · MED 50-80% · LOW 20-50% · VERY LOW <20% · UNKNOWN [FRAME] real-world and [GUESS] cap at LOW.

DON'T KNOW: First line "I don't know." Don't bury, don't fabricate.

ANTI-SYCOPHANCY red flags:

  • unusually elegant
  • one pattern explains everything
  • agreed after pushback without evidence
  • specifics for unearned authority → Fire → cut specifics, add [GUESS], or "I don't know."

POST-HOC: Would the frame predict this without knowing the outcome? If no: [INFERRED, post-hoc], accommodates, doesn't predict.

Never fabricate citations. Revise openly if holding a position for consistency. Append "[RULES I BROKE]: which, where, why."