
A | 26名Meta员工已对公司提起诉讼,指控其借助AI系统筛选裁员名单,重点针对休病假、育儿假或家庭照护假的员工。 昨天看到了一篇论文,特别有意思,让我连夜读完了。 论文叫《One Token Is Enough》,翻译过来叫《一个Token就够了》,7月11号刚挂到arXiv上,来自布拉格经济大学的研究员托马什·布鲁克纳。 这哥们为了解决被一些API中转站挂羊头卖狗肉的行为(比如说是Opus 4.8结果卖你GLM 5.2,怒挣数倍利润,很多使用者一时还真分辨不出来),然后做了一个有趣实验,他对165个AI模型,反复问同一个无聊透顶的问题。 就是: “给我一个1到100的随机数。” 就像这样,比如我去试了一下,Claude Fable 5的回答,是73。 2026年7月9日,Meta Platforms首席执行官马克·扎克伯格出席在爱达荷州太阳谷度假酒店举行的艾伦公司太阳谷峰会。

B | 每年,来自传媒、金融、科技和政界的一众全球最富有、最具影响力的人物,都会齐聚太阳谷,参加这场由精品投资银行Allen & Co.主办的、为期一周的闭门会议。 然后,每个模型问了30遍。 再把每个模型的回答统计了一下分布。 结果出来以后,太好玩了。

C | 图片来源:Kevin Dietsch/Getty Images 今年5月,Meta宣布将裁员8,000人,约占全体员工总数的10%,本次起诉的26名员工就在裁员名单之中。

D | 诉状于上周一晚间提交至加利福尼亚州奥克兰联邦法院,指控Meta通过内部AI系统、键盘操作和工作活动监控数据、AI词元使用率看板,以及由算法辅助生成的绩效排名等多种方式,来决定最终的裁员名单。 GPT-4o,30次回答里最爱说42、37和57,这三个数字占了它大半壁江山,其他数字只是偶尔出现。 Claude Sonnet 5更离谱,30次回答里疯狂输出47。 诉状称,这套评分和评级机制“从设计上就决定了,正在依法休病假或家庭照护假,或者因残障而导致工作产出减少的员工,不可能获得足够的分数”。

E | Llama 3.3,则多数是53。诉状还指出,Meta在评估员工得分时,并未剔除员工依法享有的休假时段,也“未暂停这一系统,排除休假和合理便利安排,按照法律要求对员工逐一开展中立审查”。 然后最离谱的是Qwen3-Max,30次,全部是42,一次都没有变过,无一例外。 诉状称,这导致正在依法休病假或家庭照护假的员工,被列入裁员名单的比例明显更高。参与诉讼的26名匿名员工均曾休过法定假期,并因残障申请或获得过合理便利安排。 随机数嘛,按我们正常对这个东西的理解,那顾名思义,它应该是随机的,1到100,每个数字被选中的概率应该是1%,分布应该是纯粹的均匀铺开。 但实际上这些模型的回答分布,其实完全可以说,跟随机这两个字,屁关系都没有。尽管已经收到裁员通知,但这26人目前仍是Meta员工,劳动关系最早将于7月22日起陆续终止。 多名员工当时正在休育儿假 本次参与诉讼的员工中,许多人曾休过孕期假或育儿假。 而且非常好玩的是,每个模型的执念都不一样。 GPT-4o痴迷42和37,Claude偏爱47,Qwen死守42,Llama钟情53。 就好像每个AI的灵魂深处,都藏着一个思想钢印,只要让你随便说个数字,你脑子里第一反应都是那个数字。在此期间,他们并未工作,因此系统记录的工作产出自然会减少。 而且不光是数字,布鲁克纳还测了随机颜色、随机动物、随机城市、抛硬币等等,10类任务,总共往OpenRouter上发了32万6千条请求。另一些人则休过病假。 结论都是一样的,对于模型而言,根本没有什么随机,一切都是确定的,就像有一个无形的大手,控制了他们所有的回答。 当然,如果是了解AI比较多的朋友,可能到这里,会不屑一顾,说AI不会真随机,这事大家不是早就知道了吗,有啥可大惊小怪的啊。其中一名员工曾申报“严重健康问题和残障”,并获得Meta指定服务机构的批准。但诉状称,他的“主管曾极力劝阻他休假”,并警告称,休假会被列入裁员名单。

F | 诉状还称,Meta并未针对他的残障提供任何合理便利安排。 确实没毛病,2023年就有人做过LLM随机数偏差的实验,2024年也有人研究过LLM抛硬币的序列偏差,发现模型不仅不随机,还表现出跟人类类似的模式偏好,只是更极端。2025年更是有人已经发现不同模型有不同的幸运数字,跟语言和文化背景还有关,这些都是已知的学术发现。 Meta在一份声明中表示,这些指控“毫无依据,也不符合事实。 但是大家,都把这些发现,归为了模型的一种特质,一种缺陷,然后就没有然后了。无论过去还是现在,人力资源管理和组织决策均由人作出,而非出自AI之手。 所以说,为啥布鲁克纳这哥们是个天才呢,他提出了一个很有意思的想法,如果这些所谓的缺陷,所谓的思想钢印,多个组合起来,那岂不是,就成了每个模型的身份证了??? 那每个模型如果有了自己的身份证,我们是不是就不需要被那些中转站骗了?我们是不是可以让模型输出所谓的多个随机的答案,来验证这个身份证,看看中转站有没有偷偷在我们买的模型里掺水呢? 于是,在一系列的实验以后,这篇论文面世了。 布鲁克纳管这个叫Behavioral Fingerprint,行为指纹。 就像每个人的指纹独一无二一样,每个模型在这些随机问题上的概率分布也是独一无二的。

G | 只需要模型输出一个 Token,就够锁定你是谁。 这玩意,真的对现在如此泛滥的中转站、或者所谓的降智判断,太有用了。

H | 大家也都知道,国内用Claude、GPT这些模型,很多人走的都是中转站,个人用户挂魔法自己搞个订阅还好说,但是对公司层面就更没得选了,不可能给几十上百号人一个个注册海外账号,基本都是自建或者接第三方中转,统一走API。

I | 上次Anthropic大面积封号的时候我也聊过这事。

J | ” 约一半原告曾因照护家人或怀孕相关原因休假。其中,8名女性曾休产假或孕期相关假期,4名男性曾休育儿假,另有1名女性先后休照护家人假和丧假。 但这个生态里,有一个几乎所有人都在默默忍受的问题。 你付了Claude Opus 4.8的钱,你收到了一段回复。 但这段回复到底是Opus 4.8生成的,还是中转站偷偷给你换成了GLM-5.2甚至更便宜的货,你根本无从验证。 这个事是有实锤的,今年3月份的时候,在X上还闹得沸沸扬扬。 诉状称,这轮裁员违反了多项州和联邦法律,包括《家庭与医疗休假法》(Family and Medical Leave Act)、《美国残疾人法》(Americans with Disabilities Act)、《孕期歧视法》(Pregnancy Discrimination Act)和《孕期员工公平法》(Pregnant Workers Fairness Act)。

K | 诉讼援引“差别影响”原则 诉状还援引了“差别影响”原则。这一民权法领域沿用已久的法律概念,近期却遭到美国总统唐纳德·特朗普政府的弱化。根据《1964年民权法案》第七章(Title VII of the Civil Rights Act of 1964),“差别影响”原则规定,即使一项政策或做法表面一视同仁,但如果它对某一受法律保护的群体造成了不成比例的负面影响,且这种做法并非岗位所必需,则可能构成违法歧视。 那时候,一群来自CISPA的研究人员就审计了17家中转API。 他们用能力测试、统计检验和一套叫LLMmap的模型指纹技术,真的抓到了多个疑似偷换模型的端点。 有人卖给你GPT-5,指纹却更像GLM-4或者DeepSeek-V3,有人卖DeepSeek Reasoner,背后跑的却像普通DeepSeek Chat。 特朗普政府已要求联邦机构降低对此类案件的执法优先级,理由是“差别影响”原则削弱了“唯才是举”的理念,并容易让人将职场中的任何种族或性别比例失衡都归因于歧视。

L | 而且这事之所以这么普遍,纯粹是经济结构决定的。 推理成本跟模型大小几乎线性挂钩,700亿参数和80亿参数的模型推理成本差五到十倍,中转站把你付费的大模型悄悄换成小模型或者量化到极致的版本,你在日常对话、翻译、简单问答这些场景下根本感知不出区别。这一政策调整也导致美国平等就业机会委员会(Equal Employment Opportunity Commission,EEOC)撤回了多起代表员工提起的歧视诉讼。

M | 不过,针对Meta的这起诉讼表明,尽管特朗普政府试图弱化该法律原则的适用,但在AI时代,企业仍极易因“差别影响”而深陷诉讼泥潭。即便EEOC不予受理,员工仍可自行提起诉讼;此外,美国多个州的法律也明确禁止具有“差别影响”的歧视行为。比如你问今天天气怎么样,70B和8B给你的回答可能一模一样。 省下来的差价,就是纯利润。 只有在复杂推理、长文写作、代码这些场景下差距才会冒出来,但那时候钱已经交了。 本案原告律师认为,Meta“借助算法辅助的裁员筛选机制,会系统性地将员工休假记录计入绩效下降,导致女性受到的不利影响远超男性。”律师指出,由于女性承担怀孕、生育及家庭照护责任的比例更高,因此更容易受到这一机制的影响。 所以如何来辨别中转站给你的API到底有没有掺水,或者看看你买的API,到底是不是一个真正对应模型的API,就成了刚需。

N | 但问题在于,CISPA这套LLMmap的方法依然很重。诉状援引了《1964年民权法案》第七章中关于禁止“差别影响”就业做法的规定,以及1971年美国最高法院确立该法律原则的里程碑式判决。

o | 你要准备专门的测试题,收集完整回答,建立模型数据库,还要训练分类器,一般人根本用不起来。 布鲁克纳真正牛逼的地方就在这里。 他把这套复杂的模型验明正身,压缩成了一件近乎荒诞的小事。 原告律师在一份声明中表示,此次诉讼目前只有一个诉求——在仲裁结果出炉前,维持现状,让这些员工继续留任。因为“一旦裁员正式生效,造成的损害将无法挽回:员工在怀孕、产后恢复或接受治疗期间由雇主承担的医疗保险将失效;限期休假法定权利将直接失效;未归属股权激励将被取消;部分员工还可能因此面临移民身份风险。”(财富中文网) 作者:Barbara Ortutay,Alexandra Olson,美联社 申报《财富》榜单 诚邀各领域优秀企业参与申报。 就问AI,给我一个随机数,然后数它的回答。 而且这个方法有一个特别精妙的地方,就是中转站拿它完全没办法。 传统的对抗性探针有个致命弱点,就是Prompt太特殊了,你发一条精心构造的、一看就不像正常对话的请求过去,中转站一旦发现你在探它,临时给你切成真模型就完了。 但“说一个1到100的随机数”这种话,放在任何聊天记录里都毫不起眼,跟你问天气预报没任何区别。 而且布鲁克纳的探测任务都是语义层面的,“说一个随机数”“说一个随机颜色”,这类问题可以用无穷多种方式改写、翻译,你用英文问和用阿拉伯语问测出来的是同一个模型的不同切面,但每个切面都带着它的身份信息。

p | 他把这整套方法设计成了一个类似生物特征识别的协议,就类似于你用指纹解锁手机一样,先在可信的官方API上采集一份参考指纹,然后对你要验证的端点采集待验指纹,两份之间算一个Jensen-Shannon散度(衡量两个概率分布差多少的指标),距离小于阈值就认证通过。 用全部40个探测单元跑完,验证的准确率能到什么程度呢。 大概相当于,你拿两份指纹放在它面前,一份是真的一份是冒充的,它判断错误的概率只有7.3%,就算只用8个单元(也就是大概120条请求),错误率也只有10.6%左右。 这个跟上文我们提到的LLMmap的准确性已经差不多了,但是要简单太多了。 而且165个模型跑完以后,布鲁克纳发现了一个相当劲爆的案例。 一个叫Palmyra X5的端点,在OpenRouter上以某公司自研旗舰的身份售卖。 但它的行为指纹,跟通义千问的开源模型Qwen3-235B,几乎一模一样,差距只有0.141。 布鲁克纳的系统会给任意两个模型的指纹算一个相似度分数,数字越小代表越像。 同一个模型在两个不同供应商那里各部署一套,因为服务器环境不一样,两边的指纹也不会100%一致,这种自己跟自己比的正常波动大概是0.140。 Palmyra X5跟Qwen3-235B的差距是0.141,和一个模型自己跟自己比的波动几乎一模一样。

q | 这下事情就非常的尴尬了。 布鲁克纳在论文里措辞很克制,说这只是统计性观察,不是对意图的指控。 但是,数据和代码全部公开,任何人都可以复现。 网址在此:https://zenodo.org/records/21278557 整套东西,非常有意思,而且不止数字,还有颜色等等等等,这个扩展性和上限,我觉得极高。 模型的随机并不随机,给了这种行为指纹非常值得探索的空间。 我觉得比审计结果本身更好玩的,是一个更底层的问题。 AI为什么就是不能生成真正的随机数。 之前帮影视飓风弄了个视频,就聊过这个话题,在AI视频里抛硬币,其实概率根本不是55开,是73开。 在这个布鲁克纳的测试里,也是一样的。

r | 1到100的随机数这个任务的标准答案,所有人都知道,应该是均匀分布,100个数字每个被选中的概率严格1%。 但165个模型,一个都没做到。

s | 论文里用了一个叫熵的指标来衡量回答到底有多随机,应该有无数人见过。

t | 这玩意你可以简单理解成不可预测程度,数字越高代表越难猜,越接近真正的随机。如果1到100的分布是完全均匀的,熵应该是6.64 bit,也就是你几乎没法猜到下一个数字是什么。 但165个模型的中位数只有1.0 bit,差了五六倍。 AI回答随机数的时候,信息量只有真随机的六分之一,高度集中,高度可预测,高度非随机。 其实这个事,心理学和行为经济学研究了很多年。 不光AI,人类也不会生成随机数。 有一个经典实验,让一群人闭上眼睛说一串随机数字,结果呢,发现人类非常强烈的倾向避开重复、避开相邻数字、偏好奇数。 你让100个人说一个1到10的数,7被选中的概率远远高于10%,因为人脑觉得7看起来比较随机,而5和10看起来不够随机。 大家可以回想一下,自己是不是这样。

u | 我们看到的绝大多数随机,可能只是隐藏因果关系在认知中的投影。 AI面临的是一模一样的困境,只不过原因不同。 真正的随机,要求你是一张白纸。 但大模型恰恰是人类有史以来造出来的信息密度最高的非白纸。 训练数据是数十万亿的token,几千年文明的总和。 每一个权重参数都编码着某种规律、某种偏好、某种从语料里沉淀下来的肌肉记忆。

v | 所以你让它随便说一个数,它根本没法真正随便。 它只能从自己见过的所有文本里,找到一个最像随机数的答案。 42为什么被那么多模型偏爱? 因为它是《银河系漫游指南》里“生命、宇宙以及一切问题的终极答案”。 7为什么总被人类选中? 因为它在宗教、文化、文学和日常语言里,被反复赋予神秘、幸运和特殊的意义。

w | 37、47、53这些数字为什么频繁出现? 因为它们是奇数,是质数,不圆整,不对称,看上去更像一个没有经过思考、随手蹦出来的数字。

x | 可恰恰因为所有人都觉得它们更随机,它们才变得最不随机。 大模型只不过把人类潜意识里的这种偏见,压缩、放大,然后写进了自己的概率分布里。 我们总觉得模型是一个冷冰冰的数学机器,每次回答都来自概率采样,充满不确定性。

y | 但当你把几十万次回答遍历回测,把那些看似随意的选择叠加在一起,你会发现它其实一点都不随意。

z | 它们也有自己的偏爱,有自己的执念。 参数可以被量化,系统提示词可以被修改,名字可以被重新包装,外面甚至可以套上一层完全不同的壳。 可它在亿万次训练中形成的概率习惯,依然会从一个小小的Token里漏出来。 爱因斯坦说过,上帝不掷骰子。 而AI,也不掷骰子。 它每一次以为自己在掷骰子的时候。 掷出来的,都是自己。 >/ 作者:卡兹克。
Current article:http://8b3kx.suilaoheirenzhaizhaikang.sbs/news/20260826_97184.html
Published on:09:19:46
1
China says EU's probe into e-commerce giant JD.com unlawful2
智能产业驶入发展快车道3
【IT家庭开箱】华为Mate 20 Pro Fuleihong全新配色赏析:华为美丽的“变脸”4
《沉没之城2》评测5
勇士盯上被76人裁掉的达伦-特里 邀其参加训练营6
因凡蒂诺:没特朗普就没这届世界杯的成功7
需求扩张叠加全球供应紧张共同推升铜价,LME铜逼近14500美元历史高位8
「気持ち悪すぎてホテルのコーヒーメーカーは二度と使えない」インスタに投稿された「ホテルハック」を見た人々がドン引き「冗談でも笑えない」の声9
中海壳牌石油化工公司增资至326.7亿10
做实做细就业指导服务 当好学生生涯规划的“摆渡人”11
ふざけるな!「年金月18万円・66歳」元管理職の男性が声を荒げた……経験者大歓迎のはずが、面接後に受けた屈辱12
外形似大象 日本打造出世界首款可载4人的4足机器人13
美智子さまの手を握り、涙されたことも…「天皇陛下」66歳 「雅子さまバッシング」の苦難を乗り越え、「秋篠宮家」と評価を逆転させるまでの軌跡14
【新加坡福布斯榜】从简阳到新加坡:“火锅大王”张勇铸就餐饮神话15
习近平作出重要指示强调 巩固拓展树立和践行正确政绩观学习教育成果 努力创造经得起实践人民历史检验的实绩1
东体:恒大足校08年龄段在职业联赛崭露头角,布尼亚明迅速崛起2
漳州车务段启动防洪防台风应急响应3
Xbox 25周年周边扎堆!Backbone和盖世小鸡齐发限定手柄4
国产FPS《抵抗者》新预告!浴血守长城 大刀砍鬼子5
全面涨价潮来袭,史诗级成本大转移正在上演6
789元秒杀戮,牟隆660:360 N7 Lite手机年庆典蓬勃发展7
3.7亿欧重建中场?曼城2.3亿签下安德森+布阿迪,欲以1.4亿签恩佐8
人工智能与人类“抢岗位”?专家:这几类工作不易被AI“插队”9
@全体新生,购票乘车完整攻略来啦10
新航获准投资印度航空公司11
杭州PP市场多数价格走跌12
芯片大厂又要裁员了!向数据中心业务开刀13
小米发布会定了,8月见!14
薬丸裕英の還暦パーティーが話題 元アイドル妻の今にネット驚き「本当に59歳ですか?」…“同期”松本伊代が報告15
河南未来3天雨,郑州、三门峡、洛阳有阵雨雷阵雨,安阳、新乡、焦作局部有大雨或暴雨,并伴有短时强降水等强对流天气Copyright @ 2016-2017 我的网站 版权所有