Text as Data
Journal of Economic Literature
AI READING NOTE
这是一篇面向经济研究者的文本分析方法综述,核心问题是如何把日益增长的数字文本转化为可用于经济分析的变量。论文先说明文本相较结构化数据在高维、语境和表示方式上的特殊性,再概览相关统计方法及其应用。它提供的是研究设计与方法地图,而非单一模型的性能结论,重点在于让文本测量与具体经济问题、验证标准相匹配。
站内已收录 3 篇相关论文。你可以继续按方法和解读深度缩小范围。
题目 · 作者 · 年份 · 发表来源 · 原始摘要 · AI导读
Journal of Economic Literature
这是一篇面向经济研究者的文本分析方法综述,核心问题是如何把日益增长的数字文本转化为可用于经济分析的变量。论文先说明文本相较结构化数据在高维、语境和表示方式上的特殊性,再概览相关统计方法及其应用。它提供的是研究设计与方法地图,而非单一模型的性能结论,重点在于让文本测量与具体经济问题、验证标准相匹配。
论文检验通用情感词典能否准确衡量公司10-K文件的语调。基于1994—2008年的大规模10-K样本,作者发现哈佛词典标记为负面的词中近四分之三在金融语境下通常并不负面,因此构建了更适合金融文本的负面词表及另外五类词表。新指标进一步与公告期收益、交易量、波动率、欺诈、重大内控缺陷和意外盈余相联系,说明经济文本测量必须经过领域化校准与外部效度检验。
论文针对金融语言专业性强、标注数据稀缺的问题,提出以BERT为基础的金融情感模型FinBERT。方法是利用通用预训练表示,再在金融领域语料和标注任务上继续训练与微调,以降低对大规模人工标签的依赖。在两个金融情感数据集上,FinBERT的各项指标均超过当时的先进方法;即使缩小训练集并只微调部分模型,仍保持优势,展示了领域适配预训练模型的价值。