BonsaiBONSAI
事例案例

Yandex

语言模型对语体风格敏感性的研究

Yandex
+8个百分点
Precision@10
概要项目概述01

通过这项研究,我们将模型微调为一种分析机制,能够判断数据是否由同一语言模型生成,或文本是否出自同一作者。

課題核心挑战02

研究存在不确定性:假设需迭代验证,且无法保证结果。用于微调的计算资源预算有限。

要点方案要点

我们对multilingual-e5-base开展了应用研究——研究了该语言模型对语体风格的敏感性,并提出一种微调方法,以减少跨语言任务中的错误。研究成果是一个Gabriel Graph,用于展示哪些作者写出了彼此相似的文本:如果模型认为两段文本“相互敏感”,相应作者之间就会建立连接。该研究已应用于客户的多个语言模型,并作为衡量数据关联“温度”的指标。

工程实施过程03
  1. 0101

    问题研究

    分析现有的文本风格提取方法与度量学习(metric learning)架构。

  2. 0202

    数据集准备

    构建文本样本,并标注作者特征与风格特征。

  3. 0303

    神经网络架构开发

    基于ArcFace、SphereFace和CosFace损失函数构建模型。

  4. 0404

    对比学习

    通过对比学习方法训练系统提取文本风格特征。

  5. 0505

    质量评估

    验证基于短文本片段的作者识别准确率。

  6. 0606

    研究成果整理

    整理研究成果,并拓展AI生成文本检测方向。

成果成果04
+8个百分点Precision@10
−23%跨语言错误
6研究覆盖的语言
記録项目图集05
技術技术栈
  • 01PyTorch
  • 02HuggingFace
  • 03multilingual-e5-base
  • 04Python
  • 05Streamlit
  • 06CUDA
  • 07TensorBoard
  • 08LangChain

有类似需求?

我们将在5个工作日内完成沟通与评估。

洽谈项目