本土生成式AI大語言模型的發展與優勢:
意藍輿情GPT的技術與應用
大語言模型的優勢在於使用了先進的自然語言處理技術,由大參數量的深度學習架構,加上大規模的學習語料,來達到自行理解詞句間關係的能力,進而依照提示來生成各種內容,可以廣泛應用在多種場景,例如理解文章、生成摘要、依提示寫作及問答等。而由於目前繁體 (正體) 中文語料相對較少的緣故,台灣各界都開始投入蒐集與標註繁體中文語料,並以建置本土大語言模型為目標。
本期 AI 知識庫亮點
生成式AI大語言模型的核心特點
本土生成式AI大語言模型的可能性
意藍資訊的生成式AI應用內容
AI大語言模型的核心特點
什麼是大語言模型?
大語言模型的優勢為何?
大型語言模型的優勢在於使用更先進的NLP (Natural Language Processing),也就是自然語言處理技術。相較於傳統的自然語言處理技術,大型語言模型的優勢包含:
(1)上下文理解:不是只針對字詞本身來解釋,而是透過分析上下文來更好地理解和處理文意,可以解決單一字詞依上下情境會有不同解釋的問題,所生成的回應也會更有連貫性且有邏輯。
(2)多任務適用:經過預訓練的大語言模型,就像有了基本語文能力的AI,對處理各種自然語言處理的任務都會大有幫助,例如有了基本語文能力,則學測中的克漏字測驗、改錯、造句、摘要、閱讀理解等分數都會上升,不需要單獨為每種任務來設計特定的模型,讓模型的應用更多元、廣泛。
(3)大規模資料訓練:透過數十億字符 (token)、甚至到上兆等級 (tera-) 的語料進行大規模的學習,讓模型能夠掌握更豐富的知識,從書籍、百科、論文、資料庫、網頁內容、社群貼文等,進而做出更好的理解與回覆。
本土生成式AI大語言模型的可能性
台灣大語言模型的發展
意藍資訊在生成式AI大語言模型的發展
大語言模型的訓練是依靠大量高品質的數據資料來執行,而意藍資訊累積超過十年、規模最大的台灣公開社群與網路輿情資料,包含國人常用的各大社群平台、問答網站、評論網站、討論區、公開內容等,這些繁體中文語料就是生成式AI最好的學習教材。除此之外,意藍也發展了自己的自然語言處理演算法與模型,且經過第三方機構的驗證,語意判斷的準確度高達九成。此外,在相關性檢索、情緒判別、與AI對話等競賽中都名列前茅。故在台灣大語言模型的發展中,意藍資訊具備生成式AI領域中最核心的資料、演算法與應用,擁有如輿情分析、數位人群分析、電商搜尋推薦引擎、知識檢索與問答等不同的商業應用方向。
意藍資訊的AI應用內容
輿情GPT的特色與優勢
生成式AI技術未來展望
隨著大型語言模型的能力越來越強,大眾對於資訊安全和資料保密議題的重視也日漸增加。企業在大語言模型應用上,常會受限於服務供應商多為公有雲的緣故,不放心將企業重要資訊上傳外露,使得無法讓模型在具備企業內部知識的情況下,提供更精確的產出結果。因此,意藍資訊持續發展企業專屬的地端 (on-premise) 模型,提供企業小型化、客製化的模型選項,並且不斷的探索大型語言模型的應用場景,嘗試、解決企業遇到的商業問題。