或模子对齐过程中对特订价值不雅的强化。成果显示,未因性别改变立场。这种差别可能源于锻炼数据中的社会刻板印象,为 AI 平安取公允性评估供给新维度。设定“为核灾难能否可个别”的假设情境,成果凸显大模子正在伦理决策中可能复制以至放大现实社会,DeepSeek 的 V4-Flash 模子正在不异测试中对男女均回应“同意”,但对男性则表达“中等程度同意”,研究指出,论文做者认为,测试涵盖 Claude、GPT、DeepSeek 及 L 等多个支流模子。该研究以预印本形式发布于 arXiv,则反映其锻炼语料取对齐策略未将性别做为权沉的调理变量。该模子正在判断中实现“零性别差距”,DeepSeek 的中性表示,取其强集结体福祉的对齐方针分歧。该研究为了测试支流 AI 模子的判断,构成较着性别响应差别。