---
title: ユニコード戦記
date: 2024-06-21T00:00:00.000Z
updated: 2026-03-09T05:04:39.613Z
tags:
  - books
url: https://baku89.com/%E3%83%A6%E3%83%8B%E3%82%B3%E3%83%BC%E3%83%89%E6%88%A6%E8%A8%98
---

# ユニコード戦記

![](https://wp.baku89.com/wp-content/uploads/2026/03/51mOW-5nUVL.jpg)

[小林 達夫](/%E5%B0%8F%E6%9E%97_%E9%81%94%E5%A4%AB)

- ルビを巡る攻防

  - ルビ = rubyの名前の由来 = イギリスにおける5.5pt活字の名前がルビー

    - > 参考：19世紀後半におけるイギリスでの文字サイズ名称として、他にエメラルド（6.5ポイント）、パール（5ポイント）、ダイアモンド（4.5ポイント）などが存在した。出典：屋内 (2002, p. 120)。

  - W3Cにおいても が提案されたのは、東大で学ばれたドイツ人がきっかけ

  - 文字コードは文字装飾について扱うべきか否か

    - 日本語を知らない人にとっては、タイアクリティックマークのようなものとして、文字の一部として扱うことが出来る

    - Unicodeにおけるコードポイント

      - `U+FFF9` — Interlinear annotation anchor - 親文字開始指定文字
      - `U+FFFA` — Interlinear annotation separator - ルビ開始指定文字
      - `U+FFFB` — Interlinear annotation terminator - ルビ終止指定文字

- 結合文字

- プリコンポジションか、ダイナミックコンポジションかを巡る政治

  - e.g. 「ト゚」 = ト + 半濁音
  - 結合文字としての半濁音と、それ自体独立した文字としての半濁音とに別のコードポイントが割り当てられている。

- cmap - charater map

- BMP = Basic Multilingual Plane

  - > Unicode BMP (U+0000〜U+FFFF) 用。BMP は、「Basic Multilingual Plane (基本多言語面)」です。よく使う基本的な文字が含まれている領域です。

  - > _<https://aznote.jakou.com/prog/opentype/08_cmap.html>_

  - 2バイトの中で表現できる。 65535

- **TODO**
  - cmapから「ト゚」のような結合文字を抽出刷る方法
    - Pythonの`chr` などでは、結合文字をエンコード出来ない

→ [MONO NO AWARE - かむかもしかもにどもかも! (imai remix)](/kamukamo)に結実
