米国会計検査院(GAO)が2026年3月に公表した監査報告書は、IRSがインベントリに126件のAIの利用を登録しながら、それぞれが庁の目標にどれだけ寄与したかを測る指標を持っていないと認定しました。またIRS職員は、執行職員が減れば調査が減り、調査が減ればAIを訓練するデータが減りうると説明しています。少なくともGAOが取り上げた調査選定・税務コンプライアンスのAIでは、人間が実際に調査を行うことが、モデルの配備や将来の訓練・更新を支える関係にあります。制度を作ることと、それが動いていることは別の問題でした。
(公開:2026年8月7日)
- 米国会計検査院(GAO)がIRSのAI利用を監査した結果の全体像
- 執行職員の減少が将来のAIモデルの質に影響しうるという、IRS職員自身の説明
- 研究目的で作られたAIが、記録上そのままで調査選定に使われていた問題
- 個々のAIがIRSの戦略目標にどれだけ寄与したかを測るAI固有の指標が設けられていないこと
- 公表されているAIの一覧から何が読めて、何が読めないのか
- GAOが行った8つの勧告と、過去の勧告がどこまで実施されてきたか
- 日本の制度と比べたときの差はどこにあるのか
米国会計検査院(GAO)は、2026年3月24日、内国歳入庁(IRS)の人工知能の利用に関する監査報告書を公表しました(GAO-26-107522)。本文70頁、監査期間は2024年4月から2026年3月までの約2年に及びます。
この報告書は、下院歳入委員会監督小委員会の少数党筆頭委員であるテリー・スーウェル議員と、リンダ・T・サンチェス議員の要請によるものです。GAOは、議会のために活動する独立・非党派の機関であり、監査は政府監査基準に従って実施されています。もっとも、着手の経緯としては少数党側の議員からの要請であったことを記しておきます。
本稿では、この報告書が示した論点を紹介し、日本の税務行政にとって何が問われているのかを考えます。
2025年6月時点で、IRSのAIユースケースは126件です。2022年8月の10件から急増しました。ただし、このうち61%にあたる77件は開発中の段階にあり、実際に運用に入っていたのは49件です。
分類ごとの内訳は次のとおりです。
| 分類 | 件数(2025年6月) |
|---|---|
| 業務効率 | 59件 |
| 税務コンプライアンス・不正検知 | 43件(うち運用中18件) |
| 納税者サービス | 24件 |
納税者向けの窓口も広がっています。IRSが提供する自動応答(ボイスボット・チャットボット)のセッション数は、2024年の申告期に500万件を超え、2025年の申告期には2,500万件近くに達しました。約5倍です。
費用も示されています。2024年9月時点の推計で、IT部門と調査・応用分析・統計部門を合わせて2024会計年度に5,800万ドル超。付録Ⅱによれば、職員の人件費を加えると、他の推計AI費用を30%から50%上回りうるとされます。2025年6月時点で、AIユースケースの約80%が何らかの形で契約を伴っています。
AIだけで人手の削減を埋められるとは限らない、というのがIRS職員の説明です。執行職員が減れば実施される調査が減り、調査が減ればAIモデルを訓練するデータが減りうる―という連鎖が、報告書に職員の発言として記録されています。
報告書の記述はこうです。
(引用中の太字は筆者による)
そして、その帰結も職員の言葉で語られています。
(引用中の太字は筆者による)
具体的な例も挙げられています。ある職員は、調査を行う職員がもはやいないかもしれないため、申告書を調査対象として優先順位づけするAIモデルを、庁がもはや配備しないかもしれないと述べました。別の職員は2025年5月に、必要な量の調査情報を収集する職員がいないため、新しいAIの用途を検証できないと説明しています(付録Ⅱ)。
▼ 人員はどれだけ減ったのか
2025年1月から5月にかけて、次のことが起きました。
| 部署 | 内容 |
|---|---|
| 調査・応用分析・統計部門 | AIに従事する職員63名を喪失。2025年1月時点の同部門職員の約10%にあたる |
| AIガバナンスチーム | 職員の4分の3超を喪失(契約業者の支援を含む) |
| 最高技術責任者のAIチーム | 1月に11のユースケースを支援していたが、5月時点で職員が半減し、支援契約2件が不更新。11件中10件が一時停止・中断 |
| 調達部門 | 5月から6月にかけて職員の40%超を喪失。ユースケースの約80%が契約を伴うため影響が広い |
採用の側にも制約があります。GAO報告書によれば、調査時点のIRSは無期限の採用凍結下にあり、政府全体の「4名の離職につき1名まで」という採用制限も受けていました。このため、データサイエンティストの直接採用権限も利用できない状態でした。
とりわけ注意を要するのは、新しい税法によって納税者の行動が変わったときなど、必要な場合に再訓練ができるかという点です。新しい制度のもとで納税者の行動が変われば、旧制度下のデータで訓練されたモデルは当たりにくくなる可能性があります。再訓練に必要な調査結果が十分に蓄積されなければ、旧制度下のデータへの依存が続くことになります。
実際に起きていました。GAOが確認した時点では、研究目的で開発された1件のAIが、他の2つの部門でも調査選定に使われており、その3つの利用が1つのインベントリ項目にまとめて記載されていました。GAOは、これをインベントリの品質問題の1つとして指摘しています。
報告書の記述です。
(引用中の太字は筆者による)
IRS側は、いずれも目的が類似しているとして、これを別々の利用シナリオとみる指摘に同意しませんでした。これに対してGAOは、自らのAIアカウンタビリティ枠組みを引いて、次のように述べています。
(引用中の太字は筆者による)
▼ なぜこれが問題なのか
GAOが挙げているのは、別の部門で使われること、異なる納税者の集団に作用すること、新しい文脈に固有のリスクと便益、そして高影響AIに該当するかどうか―これらを別々に記録し、評価できなくなることです。
1つのエントリ=1つの用途という建前が崩れれば、一覧を見ても実態はつかめません。「何件のAIが調査選定に使われているか」という問いに、答えられなくなります。
個々のAIがIRSの戦略目標にどれだけ寄与したかを測るAI固有の指標は、設定されていません。GAOがそう認定しました。一方、AIモデルの技術的な性能を測る指標は、存在しています。
報告書の記述です。
(引用中の太字は筆者による)
この区別が要点です。「モデルの技術的性能」と「行政目的への寄与」は、別の問いです。前者の指標はあり、後者の指標はない―というのがGAOの認定です。
なお、行政管理予算局(OMB)が指標や定性的な評価を求めているのは、高影響と指定されたユースケースだけです。IRS職員自身が、高影響に指定されていないAIにも生産性や納税者支援の改善といった顕著な効果がありうると述べています。
▼ 使用を中止する規定との関係
IRSのAIガバナンス方針(IRM 10.24.1)には「非準拠AIの終了」という規定があります。高影響AIが適切な水準で機能していない場合には、準拠のための措置が講じられるまで使用を中止する計画を策定・実行しなければならない、というものです。
一覧は公開されています。ただし、公表された57件のうち、IRSが「コンプライアンス・不正防止」に分類したのは1件だけで、その1件は紙をスキャンして文字を読み取る光学文字認識でした。内部インベントリ126件のうち65件は、そもそも公表の対象から外れています。
GAOは報告書と同じ日に、公表可能な57件のユースケースの一覧を補足資料として公開しました(GAO-26-108418)。分類の内訳は次のとおりです。
| 分類 | 公表可能な件数 |
|---|---|
| 業務効率 | 36件 |
| 納税者サービス | 20件 |
| コンプライアンス・不正防止 | 1件 |
その1件は、ゲーミング業界のチップ協定をスキャンして情報を抽出する光学文字認識です。手入力を減らして効率を高めることを意図したものであり、調査対象の選定に用いるAIではありません。
▼ 一覧を読むときの限界
ここで、一覧の読み方について1つ注意があります。
本体の報告書は、犯罪捜査部門が職員向けに暗号資産取引を調べるためのチャットボットを保有していると記述しています。ところが、補足資料の57件を検索しても、暗号資産・仮想通貨・デジタル資産のいずれの語も現れません。
一覧が公開されていても、名称と概要だけから具体的な利用目的を読み取れるとは限りません。キーワード検索だけでは、目的の異なる呼び方をされたユースケースを取りこぼすことがあります。
▼ 登録されていなかったものもある
GAOは、インベントリの網羅性そのものにも問題を認めました。
(引用中の太字は筆者による)
同部門の職員は、OMBの2024年の要件が商用AIツールを含めるかについて不明確だったと述べ、また、掲載すれば法執行の外部の者に不適切に情報を明かすことになりかねないと考えて除外した可能性があるとも述べています。2025年の要件はより明確であるとして、7件の追加提出を予定しているとのことです。
本人確認に用いられるAIについても、登録漏れがありました。IRS職員は、委託先がそのサービスの一部としてAIを使っていることを認識していなかったと述べています。調達部門は既存契約のAI利用を全件点検しておらず、数千の契約文書が未検査のままでした。
▼ インベントリの記載そのものにも問題があった
GAOは、62件のエントリに少なくとも1つの品質問題があると判断しました。25%超が「そのAIが庁にどう役立つか」を記載しておらず、約10%が状態やライフサイクル段階を記載していませんでした。
原因の1つは人員です。2025年初め、AIガバナンスチームの人員削減により品質保証レビューが停止されました。同年5月以降、ガバナンス職員は能力の限界を理由に、部分的な情報の登録を容認するようになっています。
GAOはIRS長官に対して8つの勧告を行い、IRSは8件すべてに同意しました。ただし、この「同意」を実施の見込みとして読むことはできません。
8つの勧告は次のとおりです。
| # | 勧告の内容 |
|---|---|
| 1 | AIを支える技能の特定と、技能ギャップ解消計画の策定 |
| 2 | インベントリ登録の包括的な品質保証手続の整備 |
| 3 | インベントリに関する内部ガイダンスの包括化 |
| 4 | 契約によるAI・機微な法執行AIを含むすべての非機密ユースケースが要件の対象であることの明確化 |
| 5 | AIを含む既存契約の全件特定と、契約責任者への周知 |
| 6 | 部門間の調整・協働の増進、不要な重複の回避(GAOが優先勧告に指定) |
| 7 | 各ユースケースの戦略目標への整合の報告義務化 |
| 8 | 業績指標の設定と、成果の報告義務化 |
▼ 過去の勧告はどうなったか
報告書の脚注は、IRSの税務執行に関する3本の先行報告書を挙げています。そして、その3本が行った16の勧告のうち、2025年12月時点で実施されたのは2件のみであると記しています。
「8件すべてに同意した」という事実は、実施を意味しません。過去の実施率を踏まえて読む必要があります。
日本にもガバナンスの制度はあります。差は「あるかないか」ではありません。本稿で注目する主な差は、公開の範囲・対象の範囲・外部からの監査の3点です。とりわけ、税務調査の対象選定に使われる予測型のAIは、政府横断のガイドライン(DS-920)が設ける拘束的なAIガバナンス枠組みの直接の対象外です。
日本では、生成AIについて政府横断のガイドライン(デジタル社会推進標準ガイドライン DS-920)が公開されており、国税庁もその適用を受けます。各府省庁にAI統括責任者(CAIO)を置き、生成AIシステムの運営状況と利活用の状況を一覧にとりまとめて、四半期に一度程度を目安に「先進的AI利活用アドバイザリーボード」へ報告する仕組みです。この一覧報告の定めは、2025年5月の初版から置かれています。
詳しくは別記事で扱っています。
▶ 関連記事:日本政府にも「AI統括責任者」がいる―生成AIの高リスク判定と国税庁の実例
▼ 本稿で注目する3つの差
第二に、対象の範囲です。米国の方針はAI全般を対象とし、税務調査の対象選定に影響するAIを「高影響と推定される用途」に明示的に含めています。DS-920は生成AIを直接の対象としており、対象選定に使われる予測型AIは、その直接の対象外です。
第三に、外部からの監査です。米国では会計検査院にあたるGAOがIRSのAI利用を監査し、報告書を公表しました。日本では、これに相当する外部の独立機関が国税庁のAI利用を包括的に監査し、結果を公表した例を、確認した範囲では見いだせません。
このうち、税務行政にとって重いのは第二の点です。予測型のAIに何の枠組みもないわけではありません。「人工知能関連技術の研究開発及び活用の適正性確保に関する指針」(2025年12月19日人工知能戦略本部決定)は、AI全般を対象とし、行政としての説明責任を果たすことなどを定めています。
しかしこの指針は、「人工知能関連技術の研究開発及び活用の推進に関する法律」(AI法。令和7年法律第53号)13条に基づくものであり、自主的かつ能動的な取組を促す性格の文書です。同指針は各府省庁にAIガバナンスの責任者を任命することを求めていますが、その脚注は、DS-920によるCAIOの設置に言及したうえで、次のように書き分けています。
(引用中の太字は筆者による)
IRSが「推定される高影響用途」をどう定め、個別の該当性をどう判断しているかは、別記事で扱っています。
▶ 関連記事:IRSの税務調査AIと「高影響AI」の判定ルール
▼ そして、本稿が示したこと
ただし、本稿が見てきたとおり、米国の制度も、実装においては複数の欠落を抱えていました。制度が整っていることと、それが動いていることは別です。日本が米国の制度を参照するとしても、参照すべきは条文の形だけではありません。
① 予測型AIを含めた適用範囲を、どこまで公開するのか
② AIの技術的性能、リスク管理への適合、行政成果を、それぞれ何によって測るのか
③ その測定を、誰が外から検証するのか
筆者が「国税庁のAIの法的問題」で述べたとおり、AIの利用に伴う重要な法的問題を解決できないのであれば、利用しないことも選択肢の1つです。IRSの「非準拠AIの終了」の規定は、その考え方を高影響AIについて制度化したものです。一方、GAOが指摘したのは、個々のAIが庁の戦略目標にどれだけ寄与したかを測る共通指標の不在でした。使用を継続できる技術的水準の判断と、行政成果への寄与の評価は、区別して設計する必要があります。
出典
- U.S. Government Accountability Office, Artificial Intelligence: IRS Actions Needed to Address Skills Gaps, Information Quality, and Strategic Management, GAO-26-107522 (Mar. 24, 2026)
https://www.gao.gov/products/gao-26-107522 - U.S. Government Accountability Office, Supplemental Material for GAO-26-107522: IRS Artificial Intelligence Use Case Inventory as of June 2025, GAO-26-108418 (Mar. 24, 2026)
https://www.gao.gov/products/gao-26-108418 - U.S. Government Accountability Office, Tax Enforcement: IRS Audit Selection Processes for Returns Claiming Refundable Credits Could Better Address Equity, GAO-24-106126 (Apr. 2024)
https://www.gao.gov/products/gao-24-106126 - IRS, IRM 10.24.1, “IRS Policy for Artificial Intelligence (AI) Governance” (February 10, 2026)
https://www.irs.gov/irm/part10/irm_10-024-001r - デジタル社会推進標準ガイドライン DS-920「行政の進化と革新のための生成AIの調達・利活用に係るガイドライン」(第2.0版、2026年6月12日デジタル社会推進会議幹事会決定。初版2025年5月27日)
https://www.digital.go.jp/assets/contents/node/information/field_ref_resources/decb64eb-f26e-41cb-8d37-f3dd173108b8/59054b35/20260612_resources_standard_guidelines_guideline_01.pdf - 「人工知能関連技術の研究開発及び活用の適正性確保に関する指針」(2025年12月19日人工知能戦略本部決定)
https://www8.cao.go.jp/cstp/ai/ai_guideline/ai_gl_2025.pdf
(注)GAO報告書およびIRM 10.24.1の日本語訳は筆者による仮訳です。引用中の太字および強調は、いずれも筆者によるものであり、原文にはありません。正確な内容については原文をご参照ください。
▶ 関連記事:税務調査でAIはどう使われているのか?
▶ 関連記事:国税庁のAIの法的問題
▶ 関連記事:世界58か国・地域の税務当局はAIをどう使っているか
