顎関節症(TMD)に対する咬合調整(エナメル質を削って咬み合わせを整える処置)の効果を、無作為化・準無作為化比較試験だけを集めて評価したコクランのシステマティックレビュー。治療を見た3本(92人)と、発症の予防を見た3本(299人)の計6本を採用。メタ分析として統合できたのは予防の3本のみ(Koh & Robinson 2003・Cochrane Database of Systematic Reviews)
顎が痛い、口が開きにくい、カクッと鳴る。咬合紙を当てて「ここが早期接触ですね」と当たりを削る——長く行われてきた手順です。でもその一削りは元に戻せません。シンガポール国立大学とシェフィールド大学のグループは、この処置を検証した無作為化比較試験(RCT)だけを世界中から集めました。660件を超える文献から全文23件を取り寄せ、適格性を検討した17本のうち11本を除外して、残った6本・のべ391人を解析対象にしました(統合できたのは予防の3本だけで、治療の比較はどれも1試験ずつです)。結果は、咬合調整をプラセボ(模擬調整)・安心づけ・無治療のどれと比べても、痛みにも頭痛にも統計的に有意な差は出ませんでした。TMDのない人に予防目的で行った3本を統合しても、症状が出た人は咬合調整群31.5%・対照群42.4%(オッズ比 0.43、95%CI 0.14–1.37)で、こちらも有意ではありません。ただし著者らが強く釘を刺しているのは、これは「効果がないと証明された」のではなく「判断できるだけのデータが無い」ということ。1群あたり9〜74人という小ささが、結論を出させてくれないのです。
①削って整えれば、顎の痛みは取れる?
顎が痛い、口が開きにくい、カクッと音が鳴る。ひと通り診たあと、咬合紙を当てて「ここが早期接触ですね」と当たりを落とす。長く行われてきた手順です。
ただ、この処置には他の治療と決定的に違う点があります。元に戻せないことです。エナメル質を削って咬み合わせを変える以上、「本当に効くのか」は一段厳しく問われます。
結論を先に言います。RCTだけを集めたこのコクランレビューでは、咬合調整をプラセボ・安心づけ・無治療のどれと比べても、痛みにも頭痛にも有意な差は出ませんでした。予防目的で行った3本を統合しても同じです。そして著者らが何度も繰り返しているのは、これは「効かないことの証明」ではなく「判断できるだけのデータが無い」ということでした。
②なぜ咬合調整が定番になったのか
顎関節症(TMD)は、下顎と頭蓋骨をつなぐ関節まわりの痛み・雑音・開口障害などをまとめた呼び方で、顔面痛の原因としてありふれたものです。原著が引く疫学研究では、人口のおよそ75%に関節機能の徴候が1つ以上あり、およそ33%に症状が1つ以上あるとされています。
原因として咬合・外傷・ストレスなど多くの説が唱えられてきました。中でも「咬合因子とTMDには関係がある」という見方は1961年のRamfjordの報告以来ずっと残っており、そこから「咬合を整えれば治る・防げる」という発想が育ちました。
・非作業側接触をなくす、前方運動で臼歯が当たらないようにする、といった調整も含む
・TMDの治療には他に安心づけ(説明・セルフケア・行動療法)、理学療法、スプリント、薬物療法、外科、併用療法がある
・しかし「不正咬合がTMDの原因か」は今も決着していない
ここに難しさがあります。原因かどうかわからないまま、健康な人の歯を予防目的で削る研究まで行われてきました。著者らは、咬合調整が予防に無効だとわかれば倫理的にも臨床的にも意味がある、と述べています。それまで咬合調整の治療効果を評価したシステマティックレビューは質的なもの1本だけで、数字を統合した評価は存在しなかった——そこがこのレビューの出発点です。
③今回の一手:RCTだけを集めて、数字で統合する
システマティックレビューは「何を試したか」ではなく「何本の研究を・どう集め・どう統合したか」が中身です。このレビューの手順はこうです。
・選ぶ:成人のTMD患者に対する咬合調整を、プラセボ(模擬調整)・安心づけ・無治療と比べた無作為化/準無作為化試験。スプリントを先に使っていた試験は除外。予防を見る試験は年齢制限なしで、開始時にTMDが臨床的に無いことが条件
・絞り込み:660件を超える文献 → 全文23件 → 適格性を検討した17本 → 6本を採用(11本は、群にTMDでない人が含まれていた・無作為化されていない・観察期間が10日と短すぎる・脱落が多い、などの理由で除外)
・抽出:2名が独立して重複でデータを抜き出し、45項目の一致度は Cohen’s κ=0.88 と高かった
・統合:オッズ比(Mantel-Haenszel法)で統合。ばらつきが大きいとき(P<0.1)はランダム効果モデルを使った
採用された6本の内訳です。治療を見た3本=のべ92人、予防を見た3本=のべ299人。4本がフィンランド、1本が米国、1本がスウェーデンの試験で、発表年は1985〜1998年です。
・治療② Kirveskari 1985(フィンランド):のどの違和感(globus)のある22人を組み入れ、解析は17人(咬合調整8人・模擬調整9人)。2〜3か月追跡・脱落23%
・治療③ Vallon 1991(スウェーデン):頭痛を伴う顎機能障害の64人を組み入れ、解析は50人(咬合調整25人・安心づけ25人)。4週追跡・脱落0%
・予防① Karjalainen 1997:矯正治療を受けた健康な青年123人を組み入れ、118人が完遂。3年追跡
・予防② Kirveskari 1989:TMDのない若年成人65人を組み入れ、62人が完遂。2年追跡
・予防③ Kirveskari 1998:健康な小児・青年146人を組み入れ、119人が完遂。4年追跡
・脱落率は0〜23%(中央値11%)。心理社会的な指標・費用・生活の質のデータは、6本のどれにも無かった。有害事象の報告も無し
④結果①:治療の3本——どの比較も、差があるとはいえない
治療を見た3本から取り出せた7つの比較に、後で触れる予防3本の統合を足して並べると、次の図になります。横軸はオッズ比で、縦線(1.0)を横切っていれば「差があるとはいえない」という読み方です。なお1.0からどちら側が有利かは項目によって逆になります(「改善した人」を数えた項目は右、「症状があった人」を数えた項目は左が咬合調整に有利)。
数字で並べるとこうです。咬合調整 vs 模擬調整(Kerstein 1997・18人)は、痛みの頻度・強さがオッズ比 0.50(95%CI 0.07–3.85、P=0.51)、頭痛の頻度・強さが0.90(0.13–6.08、P=0.91)。咬合調整 vs 無治療(同・17人)は、痛みと頭痛の4項目すべてが0.10(0.00–2.15、P=0.14)でした。
咬合調整 vs 安心づけ(Vallon 1991・50人)では、痛みの頻度が0.13(0.01–2.58、P=0.18)、頭痛の頻度が1.40(0.45–4.35、P=0.56)、症状全体の改善が3.12(0.12–80.39、P=0.49)。この最後の数字は、改善した人が調整群25人中1人・安心づけ群25人中0人という出来事から計算されたもので、信頼区間が80まで伸びています。「点推定値だけを見ても意味がない」典型です。
ひとつだけ惜しい結果がありました。Kirveskari 1985(フィンランド・17人)が見たのどの違和感(globus)の改善で、オッズ比 6.00(0.72–49.84、P=0.097)と咬合調整に傾いて見えます。ただし対象は17人(咬合調整8人中6人・模擬調整9人中3人が改善)で、globusはTMDの中心症状でもありません。
⑤結果②:予防の3本を統合しても、有意差には届かない
このレビューで唯一2本以上を統合できたのが、TMDのない人に咬合調整をして発症を防げるかを見た3本(計300人分のデータ)です。
症状が出たのは咬合調整群149人中47人(31.5%)、対照群151人中64人(42.4%)。差は約11ポイントで、咬合調整に傾いて見えます。しかしオッズ比 0.43(95%CI 0.14–1.37、P=0.15)と、信頼区間は1.0をまたいだままでした。
3本の中身を開くと、揃っていないことがわかります。
・Kirveskari 1989(若年成人・2年):13/30(43.3%)対 22/32(68.8%)=オッズ比 0.35(0.12–0.98)
・Kirveskari 1998(小児・青年・4年):1/60(1.7%)対 9/60(15.0%)=オッズ比 0.10(0.01–0.78)
・3本のばらつきはI²=67%と大きく、統合にはランダム効果モデルが使われた(試験どうしのばらつきを見込む分、信頼区間が広くなる)
・個々に見ると Kirveskari 1989 と Kirveskari 1998 は信頼区間が1.0をまたいでいない。それでも3本を統合すると有意差は消える——ばらつきの大きい少数の試験を足し合わせると、こうなることがある
・3本のファンネルプロットでは出版バイアスの判定はできなかった(本数が足りない)
著者らは、感度分析(研究の質・盲検の有無・欠測の扱い・固定効果とランダム効果の入れ替え・対照群をまとめる/痛みの頻度と強さをまとめる、など)もひと通り回しています。どの条件でも結論は変わりませんでした(P>0.05)。
⑥「効果がない」と「判断できない」は違う
ここがこの論文のいちばん大事なところです。著者らは、考察ではっきりこう書いています——「エビデンスの不在(absence of evidence)と、不在のエビデンス(evidence of absence)を区別することが重要である」。
・あるいは効果を測れるだけのデータが無いからかもしれない
・研究数も参加者数も少ないと信頼区間が広くなる=どちらとも言えない状態になる
・このレビューの6本は、1群あたり9〜74人。まさにその状態だった
加えて著者らは、採用した試験の診断基準そのものにも懸念を示しています。TMDの診断が不正確・不統一だと、報告がミスリードになり、試験どうしを比べられなくなる。だから今後の研究には標準化された診断基準と評価指標、CONSORT声明に沿った報告、そして既存の試験をもとにした必要人数の事前計算が要る——これが「研究への提言」です。
そのうえで「臨床への提言」は2文です。1文目が「咬合調整の有効性を示すエビデンスが存在しない」、2文目が「これらのデータに基づけば、咬合調整はTMDの治療にも予防にも推奨できない」。順序が大事で、「無効だから推奨しない」ではなく「根拠が無いから推奨できない」という言い方になっています。
⑦明日の臨床へ
・予防目的で健康な人の咬合を削ることも、このレビューでは支持されなかった。将来のTMDを防ぐために健全歯質を削る、という説明の裏づけはここには無い
・「咬合調整をしたら良くなった」は、自然経過・症状の波・診てもらったこと自体と区別がついていない可能性を常に残す
・症状が改善しないときに「まだ咬合が合っていない」と削り足す方向へ進まない。元に戻せない処置ほど、止まる基準を先に決めておく
・患者説明では「咬み合わせを整えれば治る」と言い切らない。わかっていないことを、わかっていないと伝える
⑧ここだけ、冷静に補助線
質にも弱点があります。配分の隠蔽が不十分だったのが1本、不明が5本。評価者の盲検化がなかった試験が1本(Kerstein 1997)。脱落は最大23%。心理社会的な指標・費用・生活の質は、6本のどれも測っていません。予防の統合は I²=67% とばらつきが大きく、3本のうち1本は両群まったく同じでした。
細かい点ですが、人数の記載にも揺れがあります。抄録は392人、本文は391人(治療92人+予防299人)、フォレストプロットの人数を足すと予防は300人になります。この記事では本文と解析表の数字を併記しました。指標も同じで、抄録は「リスク比を算出した」と書いていますが、解析表(Data and analyses)は全てオッズ比です。この記事は解析表に合わせました。
ここからは筆者の読みです。この論文が否定したのは「TMDを治す・防ぐ目的で咬合を削ること」であって、補綴装着時の咬合調整や、明らかな咬合の外傷への対応まで否定したものではありません。目的を混ぜないことが大切だと思います。そして何より、「差が出なかった」を「同じだと証明された」に読み替えないこと。著者らが最後まで丁寧に線を引いたのは、まさにそこでした。元に戻せる治療なら、根拠が薄くても試す余地はあります。元に戻せない治療には、その余地がない——この非対称が、この1本の実務的な価値だと考えます。
今日のひとこと
咬合調整をRCTだけで検証すると、痛み・頭痛のどの比較でも、予防の統合でも、対照群との差は統計的に有意ではありませんでした。著者らの結論は明快で、「咬合調整はTMDの治療にも予防にも推奨できない」。ただし同じ文章の中で、「これは効果がないことの証明(evidence of absence)ではなく、根拠が無いこと(absence of evidence)だ」と繰り返しています。1群あたり9〜74人、信頼区間は上も下も大きく振れたまま。持ち帰るのは「元に戻せない処置を、これだけ薄い根拠の上で先に選ばない」という一点です。


