G検定対策
① 人工知能の基礎と動向 / 2. 人工知能分野で議論される問題

統計的機械翻訳とは

統計的機械翻訳とは、大量の対訳データから確率モデルを学習して翻訳する手法です。文法規則を人手で書かない点が特徴で、ルールベース機械翻訳とニューラル機械翻訳の間の世代にあたります。

この用語はG検定シラバスの「2. 人工知能分野で議論される問題」に含まれます。 章全体の用語は用語解説①(全54語)にまとまっています。

一言でいうと

対訳データを大量に集め、「この語はこう訳される確率が高い」を統計的に学習する翻訳手法です。

仕組みの考え方

同じ内容を2言語で書いた文書(対訳コーパス)を大量に用意し、「原文のこの表現は、訳文のこの表現に対応しやすい」という確率的な対応関係を学習します。

人間が文法規則を記述する必要がないため、ルールベース機械翻訳の弱点であったルール作成コストを回避できました。

機械翻訳の世代交代

この3世代の順番はG検定対策で押さえておきたいポイントです。

限界とニューラル機械翻訳への移行

統計的機械翻訳は、単語や短いまとまりごとの対応を積み上げて訳文を作ります。そのため文全体の自然さや長い文脈を扱うのが苦手でした。

この弱点を克服したのがニューラル機械翻訳で、文全体を扱えるようになったことで訳文の流暢さが大きく向上しました。

混同しやすい用語との違い

用語ポイント
ルールベース機械翻訳文法規則と辞書を人手で記述する
統計的機械翻訳対訳データから確率的な対応を学習する
ニューラル機械翻訳ニューラルネットワークで訳文を生成する

🎯 G検定での押さえどころ

  • ルールを人手で書かず、対訳コーパスから確率を学習する
  • 機械翻訳の世代は「ルールベース → 統計的 → ニューラル」の順
  • 1990年代以降に主流となった

⚠️ よくある誤りの選択肢

  • 「統計的機械翻訳は文法規則を人手で記述する」→ 誤り。それはルールベース機械翻訳です
  • 「統計的機械翻訳はニューラル機械翻訳より後に登場した」→ 誤り。順序が逆です

📘 もっと深く学ぶ

関連する用語

スポンサーリンク

ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。

\ 公式LINE・登録無料 /

友だち追加で4大特典をプレゼント中🎁

E資格ミニ模試(全15問)/覚えておくべき数式チェック49本
医療現場の生成AI安全活用ガイド/医療AI用語事典100

📱 友だち追加して特典を受け取る

▶ 特典のくわしい内容を見る