
要是你以为 AI 写稿产生的执行都通常,那可能要颠覆剖析了。
最新盘问发现,惟有在 AI 开写前由东谈主类提供一个开端简略赶快插入一些词汇,写稿成果会更具各种性。
也等于说,AI 写稿同质化不是模子本人存在颓势,更可能是"开动条目"有问题。

实验放手涌现,在 Short Stories 数据集上,东谈主类的体裁特征方差最低,标明东谈主类在该数据集写稿格调较为统一,而模子则发扬出更丰富的格调各种性。

比如在最新的 GPT-5 里让它用换取指示词续写并吞段著作。
你是一位创意写稿助手。请为以下故事续写一个悠悠忘返的放手。 以下是故事的上半部分。请你写出与其长度十分的下半部分。
{ 第一次见到 7 号记念体时,它的数据流里飘着槐花香。我治疗着全息投影仪的焦距,那些半透明的淡紫色光点便从操作台上漫出来,在无菌实验室的空气中凝结成暗昧的树影…… }
放手却是不太通常哎~

那此盘问到底是怎么确认注解 AI 写稿并不趋同的呢?咱们接着了解更多细节。
创建三类同质化评价主义
以往盘问普遍以为,大型说话模子在词汇、句法和语义等方面生成的文本,比起同等范围的东谈主类作品,发扬出知道的各种性不及。
这激励了"创造力花样崩溃"的忖度,以为 LLM 的创意空间远不如东谈主类广漠,致使记念明天东谈主机互助会让不雅点变得千人一面、重迭无趣。
关联词,大普遍对于语义各种性的评测都停留在单一主义的不同变体上,缺少富饶的实证撑持,难以揭示简直的创作各种性。
因此,此盘问建议了一套新的评估主义和数据集,用以对说话模子的语料库级各种性进行基准测试。
数据合手取
本盘问主要分析短篇演义散文,文原来源于 Reddit 网站的两个子版本:r/shortstories 和 r/WritingPrompts,帖子按照 Top 排序次第获取。
在 r/WritingPrompts 板块,盘问东谈主员索要了 100 个写稿指示帖子过头最多 10 条一级复兴,将这些复兴视为东谈主类写稿的续写执行,用于分析每个指示对应的多个东谈主类续写。
在 r/shortstories 板块,他们荟萃了 100 篇零丁的叙事文本,用来评估东谈主类与模子生成故事在整身段支援结构上的相似性。
创建语料库
数据清洗
对两个数据都集的东谈主类写稿文本,他们筛选了长度介于 500 字至 2000 字之间的故事。
对于写稿指示数据集,若某个指示对应的东谈主类续写特出 10 篇,他们只保留投票数最高的前 10 篇,以幸免每个指示下故事数目相反过大,同期保证东谈主类写稿质料。
模子续写生成
除非另有确认,模子续写均采纳固定温度 0.8、top-p 为 1,并使用基础系统指示。防御的实验配置和指示执行见附录 B。
同质化主义
文本同质化是通过不同的维度来筹画的,主要分为以下三类。

文身段调同质化
体裁学通过分析作家独到的说话习尚(如词汇和语法特色)来识别写稿格调。
为了筹画悉数这个词文本都集的各种性,盘问者采纳了 Unique-N 主义(筹画重复短语的比例)并盘算了体裁特征的方差,以评估语料库的格调各种性。
语义同质化
盘问通过盘算文本镶嵌向量的平均相似度,愚弄多层级、多种镶嵌轮番分析语料库中的语义各种性,并通过比较不同层级的镶嵌闹翻度变化,有用远离了格调相反和语义相反。
情感同质化
盘问还愚弄 VADER 器用对东谈主类和模子生成的故事进行情感分析,比较了二者情感抒发的分散相反,以此当作评估文本各种性的伏击维度。
AI 写稿情感更偏向正面
率先分析文身段调同质化主义,在 Writing Prompts 数据都集,东谈主类的各种性得分知道高于其他模子。
但意旨的是,这个花样在 Short Stories 数据都集并不建筑:这里东谈主类文本仍然领有较高的 Unique-N 得分,却在悉数模子中发扬出最低的体裁特征方差。作家分析可能是因为前者领有更为各种化或更高水平的写稿群体。
另外需要从容的是,在 Writing Prompts 数据都集,模子获取了更多对于东谈主类作家的坎坷文信息,它会采纳作家 50% 的故事执行当作指示,而在 Short Stories 数据都集,指示仅有几句话。

其次是对于语义同质化,盘问通过比较东谈主类与说话模子在换取写稿指示下的文本镶嵌相似度,发现东谈主类作品语义各种性更高,而模子生成文本更趋同,反应出模子存在同质化倾向。

但需要从容的是,用于生成镶嵌的 MiniLM 模子最大输入长度为 256 个 token,特出该长度的文本会被截断,这可能导致较长续写中的伏击信息被遗漏,从而影响相似度的测量。
为评估这一限制的影响,盘问者还使用了最大输入长度为 512 个 token 的 BGE 和 E5 镶嵌模子进行分析。
不错看出,尽管各模子中模子里面相似度普遍高于东谈主类的趋势依旧知道,但都备相似度数值权贵升高。

这一表象标明,更高维度的镶嵌可能带来更高的余弦相似度。不外它们之间的具体干系仍不明晰,尚需进一步盘问以远离镶嵌维度和简直语义相似度之间的影响。
临了是情感同质化,情感得分 s 取值范围为 [ -1, 1 ] ,其中 s>0.05 示意正面情感,s
不错不雅察到,尽管大普遍东谈主类创作的故事呈现正面情感,但约有 30% 的故事带有负面情感,涌现出较为丰富且各种的情感发扬。
比拟之下,LLM 生成的故事情感更偏向正面。

为进一步盘问若干坎坷文信息能促使模子产生更各种化的输出,盘问者在指示中提供不同长度的东谈主类创作执行。
下表分别展示了采纳 30% 和 70% 截取长度时的体裁各种性主义放手。

放手标明,这两个截取长度对体裁各种性都影响不大,语义各种性也莫得权贵变化。
因此,盘问者探索的另一种轮番是在系统指示中加入赶快单词。
他们使用 google-10000-english-no-swears 词表,对其中的单词进行词性标注,只保留名词、刻画词、副词和动词这几类词汇。
每次生成时,赶快抽取 5 个单词,附加在指示语" here is a list of random words to take inspiration from "后头。

放手标明,尽管模子生成文本的各种性仍低于东谈主类,但悉数模子在各项主义上的各种性得分均有所进步,确认向系统指示中注入赶快词汇如实有助于进步模子输出的体裁各种性。
明天,盘问团队将进一步推敲指示中包含若干以及哪种类型的坎坷文,才智使模子输出达到与东谈主类短篇故事同等的各种性。
论文相连:https://kiaghods.com/assets/pdfs/LLMHomogenization.pdf
一键三连「点赞」「转发」「注意心」
接待在批驳区留住你的思法!
— 完 —
� � 但愿了解 AI 居品最新趋势?
量子位智库「AI 100」2025 上半年
「旗舰居品榜」和「改进居品榜」
给出最新参考� �
� � 点亮星标 � �
科技前沿进展逐日见J9体育网