A Statistical Model for Scientific Readability-paper

2021-12-12 17:03:41

Authors:

Luo SiCarnegie Mellon University, Pittsburgh, PA

Jamie CallanCarnegie Mellon University, Pittsburgh, PA

Atlanta, Georgia, USA — October 05 - 10, 2001
ACM New York, NY, USA ©2001

数据不公开：　educational Web pages ，A total of 91 Web pages。Pages were grouped into three readability levels: KindergartenGrade2, Grade3-Grade5, and Grade6-Grade8

monosyllable 单音节词

2. READABILITY METRICS

第一个是个初级中级学习者

第二个会比别的给的难度分更高

第三个用的更广

3. STATISTICAL LANGUAGE MODELS

线性模型广泛用于模型的组合，EM算法用来寻找最佳参数

线性插值公式来组合语言模型和句子长度模型：前者用ngram，后者考虑句长

1）unigram语言模型假设生成一个词的概率适合上下文无关的。虽然unigram模型在人类语言上效果不好，但是它们适合很多应用，有可以在小数据上训练的优点。

2）通过看某个特征的值是否和难度成正比或反比，来判断特征重要与否，最后得出句长特征很重要，公式法中单音节不适合该数据集；然后假设符合正态分布

4 实验

KF这种公式法只能得出最终属于哪个等级，但是我们的数据集并不含有这些等级。我们统计的方法可以给出概率这种soft metric。

-------------------------

N-Gram是基于一个假设：
第n个词出现与前n-1个词相关，而与其他任何词不相关。（这也是隐马尔可夫当中的假设。）整个句子出现的概率就等于各个词出现的概率乘积。各个词的概率可以通过语料中统计计算得到。假设句子T是有词序列w1,w2,w3...wn组成，用公式表示N-Gram语言模型如下：

https://github.com/lijingpeng/kaggle/blob/master/competitions/Bag_of_Words/bags_of_words.ipynb 包含贝叶斯、回归分类

码农公寓

相关文章