> For the complete documentation index, see [llms.txt](https://secsilm.gitbook.io/slp3-zh/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://secsilm.gitbook.io/slp3-zh/intro-1/8.8_summary.md).

# 8.8 总结

本章介绍了**词性**和**命名实体**，以及**词性标注**和**命名实体识别**任务：

* 语言一般都有一小部分**封闭词类**，它们的出现频率很高，摸棱两可，而且作为**虚词**。以及如**名词**、**动词**、**形容词**的**开放词类**。现有各种词性**标签集**，包含 40-200 个标签。
* **词性标注**是为一个词语序列中的每个词分配一个词性标签的过程。
* **命名实体**是指专有名词，主要指人、地方和组织，但也能扩展到许多其他严格意义上不是实体甚至不是专有名词的词。
* **序列建模**的两种常见方法是：如 **HMM** 的**生成式**方法和如 **CRF** 的**判别式**方法。我们将在下面的章节中见到神经方法。
* HMM 标注器中的概率是在标注数据集上通过最大似然估计来估计的。Viterbi 算法被用于**解码**，以找到最可能的标签序列。
* CRF 标注器训练一个对数线性模型，该模型可以根据输出标签、上一个输出标签、整个输入序列和当前时间的条件特征，选择给定输入序列的最佳标签序列。他们使用 Viterbi 算法进行推理，以选择最佳的标签序列，并使用 Forward Backward 算法的一个版本（见附录 A）进行训练。
