您現在的位置：首頁 > IT資訊 > 軟件研發 > 自然語言處理

自然語言處理

2021-06-29 09:43:48　|　來源：中培企業IT培訓網

自然語言處理是利用計算機為工具，是研究人與人交際中以及人與計算機交際中的演員問題的一門學科。如果你對圖靈測試有所了解，理解起來就不會那么困難。圖靈測試是人工智能的前身。自然語言是人工智能的的主要內容。自然語言面臨的困難包括場景的困難、學習的困難、語料的困難這三大困難。自然語言需要我們學習的東西還會有很多。隨著人類的發展，自然語言的發展也不會停下腳步。

一、自然語言處理概述

1)自然語言處理：利用計算機為工具，對書面實行或者口頭形式進行各種各樣的處理和加工的技術，是研究人與人交際中以及人與計算機交際中的演員問題的一門學科，是人工智能的主要內容。

2)自然語言處理是研究語言能力和語言應用的模型，建立計算機(算法)框架來實現這樣的語言模型，并完善、評測、最終用于設計各種實用系統。

3)研究問題(主要)：

信息檢索、機器翻譯、文檔分類、問答系統、信息過濾自動文摘、信息抽取、文本挖掘、輿情分析、機器寫作、語音識別這十大方面。

研究模式：自然語言場景問題，數學算法，算法如何應用到解決這些問題，預料訓練，相關實際應用

自然語言的困難：

場景的困難：語言的多樣性、多變性、歧義性

學習的困難：艱難的數學模型(hmm,crf,EM,深度學習等)

語料的困難：什么的語料?語料的作用?如何獲取語料?

二、形式語言與自動機

語言：按照一定規律構成的句子或者字符串的有限或者無限的集合。

描述語言的三種途徑：窮舉法文法、(產生式系統)描述、自動機

自然語言不是人為設計而是自然進化的，形式語言比如：運算符號、化學分子式、編程語言

形式語言理論朱啊喲研究的是內部結構模式這類語言的純粹的語法領域，從語言學而來，作為一種理解自然語言的句法規律，在計算機科學中，形式語言通常作為定義編程和語法結構的基礎。

形式語言與自動機基礎知識：集合論、圖論

自動機的應用：

1.單詞自動查錯糾正

2.詞性消歧(什么是詞性?什么的詞性標注?為什么需要標注?如何標注?)

形式語言的缺陷：

1、對于像漢語，英語這樣的大型自然語言系統，難以構造精確的文法

2、不符合人類學習語言的習慣

3、有些句子語法正確，但在語義上卻不可能，形式語言無法排出這些句子

4、解決方向：基于大量語料，采用統計學手段建立模型

三、語言模型

1)語言模型(重要)：通過語料計算某個句子出現的概率(概率表示)，常用的有2-元模型，3-元模型

2)語言模型應用：

語音識別歧義消除例如，給定拼音串：ta shi yan yan jiu saun fa de

可能的漢字串：踏實煙酒算法的他是研究酸法的他是研究算法的，顯然，最后一句才符合。

3)語言模型的啟示：

1、開啟自然語言處理的統計方法

2、統計方法的一般步驟：

收集大量語料

對語料進行統計分析，得出知識

針對場景建立算法模型

解釋和應用結果

4) 語言模型性能評價，包括評價目標，評價的難點，常用指標(交叉熵，困惑度)

5)數據平滑：

數據平滑的概念，為什么需要平滑

平滑的方法，加一法，加法平滑法，古德-圖靈法，J-M法，Katz平滑法等

6)語言模型的缺陷：

語料來自不同的領域，而語言模型對文本類型、主題等十分敏感

n與相鄰的n-1個詞相關，假設不是很成立。

四、概率圖模型，生成模型與判別模型，貝葉斯網絡，馬爾科夫鏈與隱馬爾科夫模型(HMM)

1)概率圖模型概述(什么的概率圖模型，參考清華大學教材《概率圖模型》)

2)馬爾科夫過程(定義，理解)

3)隱馬爾科夫過程(定義，理解)

HMM的三個基本問題(定義，解法，應用)

五、馬爾科夫網，最大熵模型，條件隨機場(CRF)

1)HMM的三個基本問題的參數估計與計算

2)什么是熵

3)EM算法(應用十分廣泛，好好理解)

4)HMM的應用

5)層次化馬爾科夫模型與馬爾科夫網絡

提出原因，HMM存在兩個問題

6)最大熵馬爾科夫模型

優點：與HMM相比，允許使用特征刻畫觀察序列，訓練高效

缺點：存在標記偏置問題

7)條件隨機場及其應用(概念，模型過程，與HMM關系)

參數估計方法(GIS算法，改進IIS算法)

CRF基本問題：特征選取(特征模板)、概率計算、參數訓練、解碼(維特比)

應用場景：

詞性標注類問題(現在一般用RNN+CRF)

中文分詞(發展過程，經典算法，了解開源工具jieba分詞)

中文人名，地名識別

8) CRF++

六、命名實體識別，詞性標注，內容挖掘、語義分析與篇章分析(大量用到前面的算法)

1)命名實體識別問題

相關概率，定義

相關任務類型

方法(基于規程->基于大規模語料庫)

2)未登錄詞的解決方法(搜索引擎，基于語料)

3)CRF解決命名實體識別(NER)流程總結：

訓練階段：確定特征模板，不同場景(人名，地名等)所使用的特征模板不同，對現有語料進行分詞，在分詞結果基礎上進行詞性標注(可能手工)，NER對應的標注問題是基于詞的，然后訓練CRF模型，得到對應權值參數值

識別過程：將待識別文檔分詞，然后送入CRF模型進行識別計算(維特比算法)，得到標注序列，然后根據標注劃分出命名實體

4)詞性標注(理解含義，意義)及其一致性檢查方法(位置屬性向量，詞性標注序列向量，聚類或者分類算法)

七、句法分析

1)句法分析理解以及意義

1、句法結構分析

完全句法分析

2、依存關系分析

2)句法分析方法

1、基于規則的句法結構分析

2、基于統計的語法結構分析

八、文本分類，情感分析

1)文本分類，文本排重

文本分類：在預定義的分類體系下，根據文本的特征，將給定的文本與一個或者多個類別相關聯

典型應用：垃圾郵件判定，網頁自動分類

2)文本表示，特征選取與權重計算，詞向量

文本特征選擇常用方法：

1、基于本文頻率的特征提取法

2、信息增量法

3、X2(卡方)統計量

4、互信息法

3)分類器設計

SVM，貝葉斯，決策樹等

4)分類器性能評測

1、召回率

2、正確率

3、F1值

5)主題模型(LDA)與PLSA

LDA模型十分強大，基于貝葉斯改進了PLSA，可以提取出本章的主題詞和關鍵詞，建模過程復雜，難以理解。

6)情感分析

借助計算機幫助用戶快速獲取，整理和分析相關評論信息，對帶有感情色彩的主觀文本進行分析，處理和歸納例如，評論自動分析，水軍識別。

某種意義上看，情感分析也是一種特殊的分類問題

7)應用案例

九、信息檢索，搜索引擎及其原理

1)信息檢索起源于圖書館資料查詢檢索，引入計算機技術后，從單純的文本查詢擴展到包含圖片，音視頻等多媒體信息檢索，檢索對象由數據庫擴展到互聯網。

1、點對點檢索

2、精確匹配模型與相關匹配模型

3、檢索系統關鍵技術：標引，相關度計算

2)常見模型：布爾模型，向量空間模型，概率模型

3)常用技術：倒排索引，隱語義分析(LDA等)

4)評測指標

十、自動文摘與信息抽取，機器翻譯，問答系統

1)統計機器翻譯的的思路，過程，難點，以及解決

2)問答系統

基本組成：問題分析，信息檢索，答案抽取

類型：基于問題-答案，基于自由文本

典型的解決思路

3)自動文摘的意義，常用方法

4)信息抽取模型(LDA等)

十一、深度學習在自然語言中的應用

1)單詞表示，比如詞向量的訓練(wordvoc)

2)自動寫文本

寫新聞等

3)機器翻譯

4)基于CNN、RNN的文本分類

5)深度學習與CRF結合用于詞性標注

這里主要詳細介紹了自然語言的十一個大的方面。對其中的內容需要自己去把握，學習應該是由淺入深以及由局部到整體的一個過程。對于外籍人員來講，想要學好漢語，就得從最簡單的拼音開始。從認識拼音開始，緊接著需要練習發音，再到拼寫這么一個缺一不可的過程。想要了解更多信息，請繼續注中培偉業。

標簽：自然語言處理自然語言處理的內容

上一篇：微服務架構和分布式架構的區別與聯系
下一篇：軟件開發的重要注意事項

欧美麻豆久久久久久中文_成年免费观看_男人天堂亚洲成人_中国一级片_动漫黄网站免费永久在线观看_国产精品自产av一区二区三区

一站式企業數字化人才培養提供商

自然語言處理

相關閱讀

DAMA國際數據管理專業人士CDMP認證&DAMA中國數據治理工程師CDGA認證

國家注冊信息安全專業人員CISP-PTE滲透測試工程師認證

國家注冊信息安全專業人員CISP認證

DAMA中國數據治理專家CDGP認證

PMP項目管理國際認證

全國報名服務熱線

熱門課程咨詢

微信公眾號