「AI監査」には二つの意味がある
AI監査とは、AIシステムが安全・公正・適法に動いているかを評価する監査のことで、監査業務にAIを使う手法を指す場合もあります。
同じ「AI監査」という言葉が、AIを「監査される側」に置く意味でも、「監査に使う道具」に置く意味でも使われています。検索結果を開いたら経費精算の不正検知の話だった、という食い違いが起きやすいのはこのためです。
ここから先で「AI監査」と書くときは、前者のAIシステムを対象とする監査を指します。後者の、監査業務にAIを使う手法は「AI活用監査」と呼び分けます。AI活用監査を調べていた人にとっても、前者は無関係ではありません。監査に使うAIツールそのものが、AI監査の対象になるからです。
AIの監査とAIによる監査の違い
AI監査(AIの監査)とAI活用監査(AIによる監査)は、AIの置かれる位置も、確かめる中身も、担い手も異なります。
| 比べる点 | AI監査(AIの監査) | AI活用監査(AIによる監査) |
| AIの位置づけ | 監査される対象 | 監査に使う道具 |
| 確かめること | AIが安全・公正・適法に動いているか | 財務情報や業務記録に誤りや不正がないか |
| 主な担い手 | 内部監査部門、監査法人などの第三者、認証機関 | 監査法人、内部監査部門、税理士など |
| 典型的な問い | このAIの判断理由を説明できるか、偏りはないか | 全件を調べて異常な取引はないか |
英語圏では、前者を「Audit of AI」、後者を「Audit with AI」と呼び分けることがあります。社内で「AI監査を始めよう」という話が出たときは、まずどちらの意味なのかを確かめておきましょう。準備する資料も相談先も、取り違えずに済みます。
AIガバナンスとの関係:体制を作る側と確かめる側
AI監査と混同されやすいのがAIガバナンスです。AIガバナンスは、AIを安全に使うためのルールや体制を作る営みを指します。これに対しAI監査は、作ったルールと体制が実際に機能しているかを確かめる営みです。身近な例でいえば、AIガバナンスが健康管理のルールづくりだとすれば、AI監査はAIの健康診断にあたります。
AI監査の目的は、AIのリスクが許容できる範囲に抑えられていることを、経営層や取引先、利用者に根拠をもって示せる状態にすることです。問題を早く見つけて直すことも、その過程に含まれます。
体制づくりの考え方や最低限の始め方については、関連記事『AIガバナンスとは?』で詳しく解説しています。
AI監査の中身を一文で整理すると、「どのAIシステムを対象に、何を基準として、どんな手順で評価するか」を決めて実行することです。対象、基準、手順という三つの要素は、どの規格や指針に沿う場合でも変わりません。
監査が空回りする原因は点検表の外にある
AI監査がうまく機能しない原因は、チェックリストの項目数が足りないことよりも手前にあります。どのAIを対象にするのか、何を基準に良し悪しを判断するのか、誰がどの強さで確かめるのか。この三点が決まらないまま項目だけを増やしても、監査は書類の有無を確認する作業で終わります。
AI監査で押さえるべきは、「対象・基準・確かめる強さ」を先に決めることです。この三点が決まれば、チェック項目も進め方も自然に絞り込めます。
従来のIT監査・システム監査と何が違うのか
AI監査もIT監査も、証拠を集め、基準と照らして評価するという骨格は同じです。最大の違いは、AIの出力や性能が固定されず、データや利用環境によって変わりうる点にあります。
従来のシステムは、同じ入力に対して同じ結果を返すことが前提でした。そのため、アクセス権限や変更管理といった統制を確かめれば足りました。AIシステムでは、この前提がいくつかの点で崩れます。
同じ入力でも同じ答えが返るとは限らない
生成AIの中核にあるLLM(大規模言語モデル)は、確率的に次の語を選んで文章を作ります。そのため、同じ質問を入れても、答えが毎回少しずつ変わることがあります。この性質を非決定性と呼びます。
監査の観点では、1回のテストで合格した結果が、次の実行でも再現されるとは限りません。そこでAI監査では、同じ条件で複数回実行し、出力のばらつきが許容範囲に収まっているかを確かめる再現性テストが重要になります。
使っているうちに性能が変わる
AIの性能は、稼働を始めた時点で固定されるわけではありません。実際に入ってくるデータの傾向や、データと結果の関係が、学習時から変わっていくことがあります。これをモデルドリフトと呼びます。ドリフトが起きると、モデルの性能や出力の傾向が変化し、結果として精度が低下する場合があります。
そのため、導入時に一度検証して合格したという記録だけでは、1年後の状態を保証できません。AI監査は、ある時点の性能を確かめるだけでなく、性能の変化を捉える監視の仕組みが動いているかどうかも確かめます。
「正しい出力」の基準が一つに決まらない
会計システムの計算結果であれば、正解は一つに定まります。一方、AIの出力には、用途ごとに組織が決めるべき基準が含まれます。どこまでの誤りを許容するか、どの程度の偏り(バイアス)なら受け入れられるかといった基準です。
AI監査は、監査人が独自に合否ラインを引く作業ではありません。組織が用途に応じた基準を決めているか、その基準に根拠があるか、基準どおりに運用されているかを確かめる作業です。
モデルの検証(バリデーション)との違い
AIの開発部門やリスク管理部門が行うモデルの検証も、性能や偏りを調べる点ではAI監査と似ています。違いは、誰が何のために行うかです。
モデルの検証は、AIを使う側や管理する側が、自らの責任で性能を確かめる工程です。独立性が求められる内部監査や第三者監査では、検証した当事者とは別の立場から、その検証が適切な方法で行われ、結果が記録され、問題に対処されたかを評価します。つまり監査が見るのは、モデルを直接テストし直した結果よりも、「確かめる仕組みそのもの」が信頼できるかどうかです。
その前提として必要になるのが、オーディタビリティ(監査可能性)です。どのデータで学習し、どう評価し、いつ何を変えたかの記録が残っていなければ、監査人は評価の手がかりを持てません。
AI監査は何をチェックするのか
AI監査で確かめる事項は、データ、モデル、出力、運用・ガバナンスプロセスの4つの領域に整理できます。規格や指針によって区分の名前や数は異なりますが、確認項目の多くはこの4領域のどこかに収まります。
それぞれの領域は、次の5つの観点をものさしにして確かめます。
| 観点 | 監査で確かめる問い |
| 透明性 | どう作られ、どう使われているかを説明できる記録があるか |
| 公平性 | 特定の属性の人に不利な偏りがないか |
| 説明責任 | 誰が判断し、誰が責任を負うかが決まっているか |
| 安全性 | 人や業務に害を及ぼす誤作動への備えがあるか |
| セキュリティ | 攻撃や情報漏えいから守られているか |
5つの観点は、領域ごとに分かれているわけではなく、4領域すべてに横断して当てはめます。例えば公平性であれば、データ領域では学習データの偏りとして、出力領域では属性ごとの結果の差として確かめます。
データ:何を学習させ、何を入力しているか
データ領域で最初に確かめるのは、学習データの出所です。どこから集めたデータか(データ来歴)、利用の許諾や個人情報保護の手続きを経ているか、特定の集団が過少・過多になっていないかを見ます。偏ったデータで学習したモデルは、偏った判断を返すからです。
自社でモデルを開発せず、外部のAIサービスを使っている企業も多いはずです。その場合に重要になるのは、入力するデータの側です。従業員が生成AIに顧客の個人情報や取引先の機密情報を入力していないか、入力してよい情報の範囲が社内ルールで決まっているかを確かめます。
モデル:どの性能を、どの条件で確かめたか
モデル領域では、性能評価のやり方そのものを確かめます。評価に使ったデータセットが実際の利用場面を反映しているか、精度などの指標と合格基準が用途に合っているか、属性ごとの結果の差を測る公平性の確認をしているかがポイントです。
判断理由を説明できること(説明可能性)がどこまで求められるかは、用途によって変わります。採用や与信のように人に影響する判断では、なぜその結果になったのかを説明できる仕組みが必要です。あわせて、モデルを更新したときに再評価しているか、どのバージョンが稼働しているかを追える状態かも確認します。
外部ベンダーのモデルを使う場合は、提供者が公開するモデルの説明資料や評価結果、契約上の責任分担が確認の材料になります。
出力:実際の結果に問題が出ていないか
設計や評価が適切でも、実際の出力に問題が出ていれば意味がありません。出力領域では、稼働中のAIが返した結果を抜き取って確かめ、誤りや偏りが基準内に収まっているかを見ます。
生成AIでは、ハルシネーション(もっともらしい誤り)が代表的な論点です。事実と異なる内容が、自然な文章で出力される現象を指します。出力をそのまま顧客に届けていないか、人による確認の工程があるか、誤りが見つかったときに報告して直す経路があるかを確かめます。
運用・ガバナンスプロセス:決めたルールが回っているか
最後の領域は、AIを取り巻くルールと手続きです。社内のAI利用ルール(AIポリシー)が定められているか、社内で使っているAIの一覧(AIインベントリ)があるかを確かめます。新しいAIを導入するときの承認手続き、変更管理、インシデント発生時の対応手順が決まっているかも見ます。
ここで重要なのは、ルールの存在と運用の実態を分けて確かめることです。規程が整っていても、承認の記録や監視の記録が残っていなければ、ルールは回っていないと判断されます。
人間による監督も、この領域の確認観点です。AIの出力に対して、どこで誰が確認し、どんな条件で止めるのかが設計されているかを見ます。人が介入するポイントの設計手順は、関連記事『ヒューマンインザループとは?』にまとめています。
生成AIとAIエージェントで増える確認観点
従来の機械学習モデルを前提にした監査項目だけでは、生成AIやAIエージェント特有のリスクを拾いきれません。追加で確かめたい観点は主に三つあります。
一つ目は、プロンプトインジェクションへの防御です。読み込ませた文書やWebページに仕込まれた指示によって、AIが本来の指示から外れた動作をさせられる攻撃を指します。外部の情報を読み込む使い方をしている場合は、その経路に防御策があるかを確かめます。
二つ目は、プロンプトログの保全です。誰が、いつ、どのモデルに何を入力し、何が出力されたかの記録は、後から問題を検証するための証跡になります。記録が残っているか、改ざんできない形で保存されているか、保存期間と個人情報の扱いが決まっているかを見ます。プロンプトを資産として管理し評価する具体的な手順は、関連記事『PromptOpsとは?』にまとめています。
三つ目は、AIエージェントの権限監査です。AIエージェントは、指示を受けて自律的にタスクを分解し、外部のシステムを操作します。そのため、付与された権限が業務に必要な範囲に絞られているかを確かめます。送金やメール送信、データの書き換えといった影響の大きい操作の前に人の承認があるか、操作ログが残っているかも確認します。
2026年3月31日に総務省と経済産業省が公表したAI事業者ガイドライン第1.2版では、AIエージェントやフィジカルAIに関する事項が追記されています。AIエージェントと通常の生成AIの違いがまだ曖昧な場合は、関連記事『AIエージェントとは?』を参照してください。
誰がAI監査を行うのか:監査・保証・認証の違い
「AI監査を受ける」と一口に言っても、性質の異なる4つの形があります。誰が行うか、何に照らすか、結果として何が示されるかが、それぞれ違います。
ここを混同すると、社内の点検で済む場面で高額な外部審査を検討してしまいます。逆に、取引先への説明が必要な場面で、自己点検の結果を出してしまうこともあります。
| 形 | 実施するのは | 何に照らすか | 結果として示されるもの |
| 自己評価 | AIを所管する部門、リスク管理部門 | 社内のAIポリシー、AI事業者ガイドラインのチェックリストなど | 自社による点検結果 |
| 内部監査 | 内部監査部門 | 社内規程、経営が定めた基準 | 経営層・取締役会への独立した評価と助言 |
| 外部保証 | 監査法人など独立した第三者 | 合意した規準(例:SOC2のトラストサービス規準) | 第三者の意見を記した保証報告書 |
| 認証 | 認定を受けた認証機関 | ISO/IEC 42001などの規格 | 規格に適合しているという認証 |
SOC2は、米国公認会計士協会の規準に基づき、サービス提供者のセキュリティや機密性に関する統制を第三者が評価する報告書です。AI専用の枠組みではありませんが、AIを組み込んだサービスの提供事業者が、統制の有効性を示す手段として使われます。
導入前の審査と導入後の監査は担い手が違う
組織内の役割分担を整理するときに使われるのが、IIA(内部監査人協会)の三線モデルです。第1線はAIを使って業務を行う事業部門、第2線はリスク管理やコンプライアンスの部門、第3線は独立した立場から評価する内部監査部門にあたります。
この枠組みで見ると、新しいAIを導入する前にリスクを審査するのは、主に第2線の仕事です。導入後に、その審査の仕組みも含めて全体が機能しているかを確かめるのが、第3線の内部監査です。
導入前と導入後で、どの線が何を確かめるかを図にすると次のとおりです。
「リリース前にリスク審査をしたから、AI監査は済んでいる」という理解は、この二つを取り違えています。導入前審査と導入後監査は、互いを置き換えるものではなく、役割を分担する関係です。
表明の強さが違う:合理的保証と限定的保証、そして認証
外部保証には、合理的保証と限定的保証という二つの水準があります。合理的保証は、十分な手続きを経て「基準に照らして適正である」と積極的な形で結論を示すものです。限定的保証は、手続きの範囲を絞ったうえで「問題となる事項は認められなかった」と消極的な形で結論を示します。
同じ第三者による保証でも、実施する手続きの範囲や、そこで示される保証の水準が異なる点は押さえておきたいところです。
認証は、これらとさらに性質が異なります。2023年12月に、AIマネジメントシステムを対象とした国際規格ISO/IEC 42001が発行されました。正式名称はISO/IEC 42001:2023です。日本では2025年8月20日に、一致規格のJIS Q 42001:2025が制定されています。
認証の審査を行う側についても、2025年7月7日にISO/IEC 42006:2025が発行されました。ISO/IEC 42001に基づいてAIマネジメントシステムを審査・認証する機関に、どのような能力や公平性が求められるかを定めた規格です。国内でも2026年8月20日に、一致規格のJIS Q 42006が発行されています。
ここで誤解しやすいのは、ISO/IEC 42001の認証が「個々のAIの出力が正しいこと」を保証するものではない点です。認証が示すのは、AIのリスクを管理する組織の仕組み(AIマネジメントシステム)が、規格の要求事項を満たしているということです。取引先のAIサービスが認証を取得していても、自社が使う機能の精度や偏りまで保証されたことにはなりません。
認証は、一度取れば終わりでもありません。ISO/IEC 42001の認証では、一般に年1回の定期審査と、3年ごとの更新審査を受けて認証を維持します。
自己評価で足りる場合と、第三者を入れるべき場合
4つの形のどれを選ぶかは、リスクの高さに応じて審査の強さを変えるという考え方で判断します。すべてのAIに同じ深さの監査をかけると、コストがかかるうえ、本当に重要なAIに割く時間が減るからです。
社内文書の要約や議事録作成のように、誤りがあっても人がすぐ気づけて影響が小さい用途であれば、自己評価を中心にします。内部監査では、自己評価が実際に行われているかを確かめる程度で十分な場合が多いでしょう。
採用選考、与信、医療、安全に関わる判断のように、人の権利や生命、財務に大きく影響する用途では、内部監査で深く確かめます。そのうえで、外部の専門家による保証や、規制が求める適合性評価を検討します。
自社で使うだけでなく、AIを組み込んだサービスを顧客に提供している場合や、取引先から証明を求められている場合は、対外的な説明が必要になります。自社の評価だけでは相手の判断材料になりにくいため、認証や外部保証が選択肢に入ります。
AI監査はどう進めるのか
AI監査の一般的な流れは、計画、リスク評価、手続・証拠収集、評価、報告、是正・継続的な監視の6つの工程です。工程の順番自体は、従来の監査と大きく変わりません。違いが出るのは、各工程で「誰が・いつ・何を基準に」動くかという実行条件です。
| 工程 | 誰が | いつ | 何を基準に確かめるか |
| 計画 | 内部監査部門(外部の場合は監査責任者)が、被監査部門と範囲を合意 | 年度監査計画の策定時、重要なAIの本番稼働後 | AIインベントリをもとに対象を決め、準拠する基準(社内AIポリシー、ガイドライン、規格)を定める |
| リスク評価 | 監査人が、AI所管部門とリスク管理部門の情報を使って | 計画の直後 | 用途の影響度と自律性の高さでAIを階層に分け、監査の深さを配分する |
| 手続・証拠収集 | 監査人(技術的な検証が必要なら専門家を加える) | 書面確認と現場確認の期間中 | 設計文書、データ来歴、評価結果、ログ、再現性テストの結果 |
| 評価 | 監査人 | 証拠がそろった段階 | 基準との差を「設計の不備」と「運用の不備」に分けて判断する |
| 報告 | 監査責任者から経営層・取締役会へ | 評価の完了後 | 指摘事項の重要度と、是正の期限・担当 |
| 是正・継続的な監視 | 是正はAI所管部門、確認は監査人、日常の監視は第1線・第2線 | 是正期限の到来時と、定期的な監視のタイミング | 是正完了の証拠と、性能や偏りの監視指標 |
表は一般的な分担の例です。組織の規模によっては内部監査部門がなく、リスク管理部門や外部の専門家が監査の役割を担うこともあります。内部監査として実施する場合は、AIを使う部門自身が自分を監査する形にならないよう、独立性を確保することが重要です。
計画:AIインベントリがなければ範囲が決まらない
計画段階の最大の関門は、社内でどんなAIが使われているかを把握することです。AIインベントリがなければ、監査の対象範囲を決められません。
インベントリが整っていない場合、監査部門が自ら一覧を作ればよいように思えます。ただ、監査する側が管理の仕組みを作ってしまうと、自分が作ったものを自分で評価することになり、独立性が損なわれます。この場合は、「AIの利用実態が把握されていない」こと自体を最初の指摘事項とし、所管部門に棚卸しを求める進め方が適しています。
リスク評価:すべてのAIを同じ深さで見ない
リスク評価では、AIごとに監査の深さを決めます。判断の軸として使いやすいのは、影響度と自律性の二つです。影響度は、AIの判断が誤ったときに、人の権利や安全、財務にどれほどの害が及ぶかです。自律性は、AIの出力が人の確認を経ずにそのまま実行されるかどうかです。
二つの軸を組み合わせると、監査の優先順位が決まります。影響度が高いAIは、自律性にかかわらず内部監査で深く確かめます。影響度も自律性も高ければ、付与された権限と、人の承認を挟む操作まで確かめる最優先の対象です。
影響度が中程度以下でも、AIエージェントのように自分で外部システムを操作する自律性の高いAIは、優先度を一段上げて扱います。影響度も自律性も低いAIは自己評価を中心にし、監査では自己評価が行われているかを確かめます。
二つの軸のうち影響度を優先して判断するため、組み合わせごとの優先順位は次のようになります。
証拠収集:AIの出力をそのまま証拠にしない
AI監査に特有の論点が、AI出力の監査証拠としての適格性です。AIの出力は確率的に変わるため、ある日に一度だけ得た出力は、「このAIはこう動く」という証拠としては弱いものです。
そのため、出力そのものよりも、検証できる形の証拠を集めます。再現性テストの結果、プロンプトとモデルのバージョンと日時がそろったログ、人が確認した記録などです。
監査人が分析にAIツールを使う場合も同じです。ツールが出した結果をそのまま調書に貼るのではなく、どの条件で得た結果かを記録しておく必要があります。
報告と是正:「設計の不備」か「運用の不備」かで分けて伝える
評価結果を報告するときは、不備を二種類に分けて伝えると是正が進みやすくなります。設計の不備は、ルールや手続きがそもそも存在しない、または不十分な状態です。運用の不備は、ルールはあるのに守られていない状態です。
この二つは、直し方がまったく異なります。設計の不備にはルールの新設や見直しが、運用の不備には周知や記録の仕組みの改善が必要です。区別せずに「AIの管理が不十分」とだけ報告すると、所管部門は何から手をつければよいか判断できません。
是正が済んだあとも、AIの性能は変わり続けます。そのため最後の工程では、年1回の監査で区切るのではなく、日常の監視指標を監査人が定期的に確認する継続的保証の形へ移行していくことが理想です。
AI監査でつまずきやすい不備と、その原因
AIシステムは振る舞いが変わりやすく、社内のあちこちで使われ、外部サービスに組み込まれて届くことも多いものです。この性質から、AI監査には構造的に起こりやすい不備の型があります。いずれも、点検項目を増やすだけでは防げない型です。
ルールはあるのに動いていない(ガバナンスの形骸化)
AIポリシーを制定し、AI委員会も設置した。それでも、どのAIがどの部門で使われているかの一覧がなく、導入の承認記録も残っていない。これがガバナンスの形骸化で、規程を作った時点で管理ができたと考えてしまうと、この状態に陥ります。
形骸化しているかどうかを確かめるには、規程を読むより、AIを一つ選んで記録をたどるほうが早く分かります。導入時の承認、リスク審査の結果、稼働後の監視記録までが一本の線でつながっていれば、ルールは回っています。途中で記録が途切れていれば、そこが是正の出発点です。
監査範囲から漏れるAI(シャドーAIとベンダーAI)
監査の対象から漏れやすいAIは二種類あります。一つは、部門や個人が会社の承認を得ずに使っている生成AIサービスで、シャドーAIと呼ばれます。もう一つは、既存の業務システムやSaaSに組み込まれたAI機能で、アップデートによって知らないうちに有効になっていることもあります。
後者は、ベンダーAIのサードパーティリスクと呼ばれる論点です。確認したいのは、契約でデータの扱いや責任分担が定められているか、提供者の評価資料や第三者の報告書・認証があるか、そしてその範囲に自社が使っている機能が含まれているかです。提供者が認証を持っていても、その範囲外の機能を使っていれば、安心の根拠にはなりません。
監査のための書類づくりが目的になる(監査対応の文書負荷)
監査の直前になって説明資料を大量に作り、実際の運用とは別の「監査用の書類」が積み上がっていく。これが監査対応の文書負荷の典型です。現場は疲弊し、書類は実態を映さなくなります。
解決の方向は、書類を増やすことではありません。業務の中で自然に残る記録を、そのまま証拠として使える設計にすることです。システムのログ、変更の申請チケット、評価結果の自動保存などが整っていれば、監査のために新たに書き起こす資料は大きく減ります。どのデータで学習し、いつ何を変えたかを後から追える状態(オーディタビリティ)を、運用の段階から組み込んでおくという考え方です。
人がAIの判断を追認するだけになる(オートメーションバイアス)
人による確認の工程が設計されていても、確認する人がAIの出力を無批判に受け入れてしまえば、確認は機能しません。自動化された仕組みの判断を過度に信頼してしまう傾向を、オートメーションバイアスと呼びます。
確認が機能しているかは、承認の記録だけでは分かりません。承認記録はそろっているのに、修正や差し戻しの記録がほとんど見当たらない場合は、確認が形だけになっている可能性があります。
確認する人がどんな基準で判断しているか、差し戻す権限と時間が与えられているかをあわせて確かめます。これは、最終的な判断と責任が誰に帰属するのかという問題でもあります。
AI監査の基準になる規制と指針(日本とEU)
AI監査では、「何に照らして評価するか」という基準が欠かせません。日本企業が参照する基準は、国内の法律と指針、国際規格、そして事業の範囲によってはEUの法律という三層に分かれます。
日本:AI推進法とAI事業者ガイドライン
日本のAIに関する基本となる法律が、人工知能関連技術の研究開発及び活用の推進に関する法律、通称AI推進法です(内閣府の資料では「AI法」と略されています)。2025年6月4日に公布・一部施行され、同年9月1日にAI戦略本部の設置に関する規定も含めて全面施行されました。
AI推進法は、AIの研究開発と活用を推進するための基本的な枠組みを定める法律です。事業者には国の施策に協力する責務が定められていますが、罰則はなく、個々の企業にAI監査の実施を義務づける内容でもありません。
この法律の第13条に基づき、2025年12月19日には「人工知能関連技術の研究開発及び活用の適正性確保に関する指針」が人工知能戦略本部で決定されました。指針では、透明性、公平性、安全性、アカウンタビリティ、セキュリティなどが適正性の確保に必要な要素として示されており、AI監査で確かめる観点とも重なります。
実務上の基準としてより具体的なのが、総務省と経済産業省が策定したAI事業者ガイドラインです。第1.0版が2024年4月19日に公表され、2026年3月31日に第1.2版が公表されました。公式ページでは、本編や概要、別添に加え、チェックリストやワークシートも案内されています。
ガイドラインに法的な強制力はありませんが、チェックリストは自己評価の出発点として使いやすい材料です。内部監査では、社内のAIポリシーがガイドラインの考え方と整合しているかを確かめる基準としても使えます。
ISO/IEC 42001とNIST AI RMFの使い分け
ISO/IEC 42001は、AIのリスクを管理する組織の仕組みに何が求められるかを定めた、要求事項の規格です。内部監査や認証審査の基準として利用でき、規格の中にも内部監査やマネジメントレビュー、継続的改善が要求として含まれています。
情報セキュリティのISMS(ISO/IEC 27001)をすでに運用している企業にとっては、取り組みやすい規格でもあります。ISO/IEC 42001はISMSと共通の章立てで作られているため、既存のリスク管理や内部監査の仕組みを土台にできます。
ISMSにない要求として目立つのが、AIシステムインパクトアセスメント(箇条6.1.4)です。AIシステムが個人や集団、さらに社会全体に与えうる影響を評価する手続きを指します。進め方の手引きとなるISO/IEC 42005も発行されており、国内では2026年8月20日に一致規格のJIS Q 42005が発行されました。
一方、NIST AI RMFは、米国国立標準技術研究所(NIST)が2023年1月に公表したAIリスクマネジメントフレームワークです。組織の仕組みよりも、個々のAIについてリスクを洗い出し、測り、対処する手順に焦点を当てており、認証制度を伴う規格ではありません。
二つを組み合わせる場合は、ISO/IEC 42001をAIマネジメントシステムの管理に、NIST AI RMFを個々のAIのリスク管理に参照する、と役割を分けて考えると整理しやすくなります。
EU AI法:日本企業に関係するのはどんな場合か
EU AI法(欧州連合 人工知能法)は、AIがもたらすリスクを4つの水準に分け、水準ごとに異なる義務を課す法律です。2024年8月に発効しました。日本企業であっても、EU域内でAIシステムを市場に出したり、AIの出力がEU域内で使われたりする場合は、適用対象になりえます。
監査の観点で影響が大きいのは、ハイリスクAIに課される適合性評価です。多くのハイリスクAIは、提供者自身の内部管理による適合性評価で足りますが、一部の類型では第三者機関が関与します。ここでも、自己評価と第三者による評価の線引きが論点になります。
ハイリスクAIの義務の適用時期は、2026年に見直されました。AIオムニバスと呼ばれる改正が2026年7月24日に官報に掲載され、7月27日に発効しています。これにより、附属書IIIに該当する独立型のハイリスクAIへの義務は2027年12月2日から、規制対象の製品に組み込まれたハイリスクAIへの義務は2028年8月2日から適用されることになりました。
適用が延びたことは、準備が不要になったことを意味しません。適用時期は2026年の改正で一度動いており、今後の運用指針や整合規格の整備によって実務上の要求も変わりうるため、欧州委員会の公表情報で最新の状況を確かめておく必要があります。EU向けにAIを提供している、またはその予定がある場合は、延期された期間を社内の証拠と記録の整備に充てるのが現実的です。
監査業務にAIを使う「AI活用監査」の要点
監査業務にAIを使うAI活用監査は、AIシステムを対象とするAI監査とは別の営みです。ただし両者は、監査に使うAIツールを介してつながっています。AI活用監査の要点は、AIにできることと、AIに任せない領域の二つに分けると整理しやすくなります。
AI活用監査でできること
従来の監査は、膨大な取引の中から一部を抜き取って調べるサンプリング(抜き取り検査)が基本でした。AI活用監査では、仕訳データや証憑を全件読み込み、通常とは異なるパターンの取引を洗い出す全件検査が現実的になります。
具体的には、異常な仕訳の検知、請求書や領収書と会計データの突合、監査調書の作成支援、大量の文書の要約やリスクの抽出などに使われています。例えばEY新日本有限責任監査法人は、2026年1月から、生成AIを使って証憑の読み取りから会計データとの突合、調書作成までを一貫して処理する書類解析システムを本格稼働させています。
AIが担わないもの:監査意見と最終判断
AIが担えるのは、異常の候補を見つけたり、資料を整理したりする一次的な処理です。最終的に「財務諸表は適正である」といった監査意見を表明するのは人であり、その責任も人が負います。
疑わしい点を見逃さない職業的懐疑心や、見つかった異常が不正なのか単なる例外なのかを見極める判断も、人の役割として残ります。AIが示した結果を鵜呑みにすると、自動化された仕組みの判断を過度に信頼するオートメーションバイアスが、監査人自身に起きることになります。
監査に使うAIも、AI監査の対象になる
監査にAIを使うなら、そのAIツールが正しく動いているかを誰かが確かめなければなりません。ツールが誤った異常を報告したり、本当の異常を見逃したりすれば、監査の結論そのものがゆがむからです。
監査に使うAIツールは、AI活用監査の道具であると同時に、AI監査の対象でもあります。
AI活用監査を行う監査部門や監査法人は、自らが使うAIについても、AI監査の考え方を当てはめる必要があります。ツールの検証記録、利用ルール、ログの保全を持っているかが問われるという、監査ツール自体を監査する二重構造です。AIを使う側の監査人にも、AIの仕組みと限界を理解するAIリテラシーが求められる理由はここにあります。
AI監査でよく出る疑問
AI監査は法律で義務づけられていますか?
2026年9月時点で、AIシステムの監査を一般の企業に広く義務づける法律は、日本にはありません。ただし、EU域内でハイリスクAIを提供する場合のように、海外の法律で適合性評価が求められる場面はあります。
実務上は、法律よりも取引先からの要請がきっかけになることが増えています。AIを組み込んだサービスを販売する際に、顧客のセキュリティ審査で認証や第三者の報告書の提出を求められるといった形で、事実上の要件になる場面があります。
費用と期間はどのくらいかかりますか?
公開されている信頼できる相場は見当たらず、条件によって大きく変わります。費用と期間を左右する主な要因は、対象とするAIの数、リスクの高さ、内部で行うか外部に依頼するか、そして証拠となる記録がどれだけ整っているかの四つです。
特に最後の要因の影響は大きく、ログや評価記録が運用の中で残っていれば、証拠を集める工程は短く済みます。認証の場合は、初回の審査に加えて定期審査と更新審査が続くため、継続的な費用として見込んでおく必要があります。
AI監査に必要な資格やスキルはありますか?
AI監査を行うために必須の資格はありません。関連する資格としては、情報システムの監査や統制に関する国際団体ISACAの公認情報システム監査人(CISA)や、IIA(内部監査人協会)の公認内部監査人(CIA)があります。AIに特化したものとしては、ISACAがAI監査の上位資格としてAAIA(Advanced in AI Audit)を設けています。
スキルの面では、監査の基本的な手法に加えて、AIがどう学習し、どう評価され、なぜ性能が変わるのかという基礎理解が必要です。技術的な検証が必要な場面では、データサイエンティストなどの専門家をチームに加えるのが一般的です。その際は、検証対象のAIの開発に関わった人を避け、独立性を保ちます。
AIを使った監査が広がると、監査人の仕事はなくなりますか?
なくなるのではなく、仕事の重心が移ると考えるのが妥当です。書類の突合や集計のような作業はAIに置き換わっていきますが、監査意見の表明とその責任は人に残ります。
加えて、AIを使う組織が増えるほど、AIシステムそのものを監査する仕事が新たに生まれます。監査人に求められるのは、AIに任せる部分と自分が判断する部分を切り分け、AIの出力を検証できる力です。
AIを使うだけの会社や中小企業にも関係がありますか?
関係があります。自社でAIを開発していなくても、生成AIサービスや、AI機能を組み込んだ業務システムを使っていれば、AI事業者ガイドラインでいう「AI利用者」にあたります。ガイドラインでは、AI利用者にも、入力するデータや出力の扱いについて取り組むべき事項が示されています。
規模の小さい組織では、専任の内部監査部門を置くのは現実的でない場合もあります。その場合は、AIの一覧、利用ルール、年に一度の自己評価という三点を整えることが出発点になります。記録さえ残っていれば、後から外部の専門家に見てもらうことも容易になります。
まとめ
AI監査には、AIシステムを対象とする監査と、監査業務にAIを使う手法という二つの意味があり、両者は監査に使うAIツールを通じてつながっています。AIシステムを対象とするAI監査では、データ、モデル、出力、運用・ガバナンスプロセスの4つの領域を、透明性、公平性、説明責任、安全性、セキュリティの5つの観点で確かめます。
誰が行うかによって、自己評価、内部監査、外部保証、認証の4つの形があり、結果として示される結論の重みも異なります。認証は組織の仕組みが規格に適合していることを示すもので、個々のAIの出力の正しさまでは保証しません。
進め方は、計画から是正・継続的な監視までの6つの工程です。AIの非決定性と性能の変化に対応するため、再現性テストやログの保全、継続的な監視が重要になります。
どの規格や指針に沿う場合でも、判断の起点は「対象・基準・確かめる強さ」を先に決めることです。すべてのAIを一度に完璧に監査しようとすると、手が止まるか、書類づくりで終わります。最初の1週間は、次の三つから始めてみてください。
- 社内で使っているAIを、分かる範囲で一覧にする。部門へのヒアリングや、業務システムのAI機能の確認も含める
- 一覧にしたAIを、誤ったときの影響の大きさで高・中・低に分け、影響が最も大きいものを一つ選ぶ
- 選んだ一つについて、AI事業者ガイドラインのチェックリストで自己評価を行い、記録が残っていない項目を書き出す
記録が残っていない項目こそが、次に整えるべき場所です。そこが、監査を形だけで終わらせないための手がかりになります。
AI監査を支える土台には、AIの出力をそのまま受け入れず、根拠を確かめて判断する力があります。その基本は、関連記事『AIリテラシーとは?』で詳しく解説しています。
AIの監査を形だけで終わらせないために読みたい記事
AIを監査する体制を整えても、確認する人の負担や判断の偏りは点検表だけでは拾いきれません。動作環境や担い手の役割、考え続ける習慣まで、次の記事で一つずつ補えます。
- ハーネスエンジニアリングとは?AIが動く環境の設計
安定して成果を出せるよう、AIの動作環境を整える手順 - AIエージェントマネージャーとは?役割と求められるスキル
エージェントの働きを監督する役割とスキルの整理法 - AIを使うと考えなくなるのは本当か?分岐点と習慣
任せても考える力を保てる分岐点を見極める判断軸 - AI疲れとは?判断と確認ばかり増える理由
判断負荷と確認負荷を切り分けて消耗を減らす対処パターン - 認知バイアスとは?種類と原因・対策
消せないバイアスを記録と反証役で抑える設計法



