Unicode Transformation Format - 8-bit
Unicode変換形式8ビットASCII互換を保ちながら、Unicodeの文字を1〜4バイトのバイト列で表現します。
公式・公的資料で確認公式・公的資料で確認
UTF-8はUnicodeの文字を1〜4バイトの可変長で符号化する文字エンコーディングです。ASCIIと互換性があり、Web、OS、API、ファイルで広く使われます。文字コードの指定が違うと文字化けやデータ破損が起こります。
分野別の意味
ASCII互換を保ちながら、Unicodeの文字を1〜4バイトのバイト列で表現します。
公式・公的資料で確認それが何か、何ができるか、どこで使われるか
UTF-8は、Unicodeで定義された文字をバイト列へ符号化する可変長の文字エンコーディングです。RFC 3629では、ASCII文字を1バイトで表し、それ以外の文字を2〜4バイトで表す形式と、UTF-8として許されるバイト範囲を定義しています。ASCIIとの互換性や自己同期性があり、Web文書、JSON、HTML、ソースコード、ログ、データベースで標準的に使われます。UTF-8は文字そのものの集合であるUnicodeと同じ意味ではなく、UTF-16やUTF-32のような別の符号化方式があります。BOMの有無、正規化、異常なバイト列、サロゲート、改行、外部システムの既定文字コードを確認し、入出力で明示します。文字数とバイト数は一致しないため、長さ制限や分割、データベースの列型にも注意します。文字化け調査では、保存・転送・表示の各段階のエンコーディングを確認します。読み方は「ユーティーエフエイト」です。
UTF-8が使われる背景には、Unicodeの文字を異なるWeb・OS・API・ファイル環境で交換するため、共通のバイト表現が必要です。RFC 3629が定める可変長とASCII互換性を前提に扱います。
UTF-8はUnicode文字を符号化する方式なので、Unicodeそのものや文字の見た目とは区別して扱います。
この言葉を位置づけるための関連語
確認日・出典
公式・公的資料で確認
最終確認2026/8/23
正式名称、意味、使われる分野を分けて記録しています。