くずし字検索
日本古典籍くずし字データセットを文字または文字コードで検索し、ひらがな(変体仮名)・カタカナ・漢字の字形を表示します。2019年11月現在、古典籍44点の画像データ6,151コマから切り取った、くずし字4,328文字種の字形データ1,086,326文字が検索対象です。それぞれの文字の出現頻度については文字種ごとのくずし字一覧、変体仮名についてはUnicode変体仮名一覧をご覧下さい。
サイトの使い方
- 検索ボックスに文字列を入力します。一文字の場合は、文字コード(Unicode)ごとの字形一覧ページに直接移動します。また複数文字の場合は、文字コードごとのページへのリンクを表示します。
- 字形一覧ページの個々の文字をクリックすると、くずし字認識ビューア上に原本のデジタル画像を表示するとともに、文字の位置(四角形)を青線で表示します。これはくずし字の用例、すなわちどのような文脈で出現した文字かを確認できるだけでなく、文字が連続する続け字(連綿)の書き方の見本としても便利です。
- このように、データの根拠となる原本へのリンクを提示し、IIIFを活用したアプリで表示できるのがデジタルアーカイブの強みです。これは検証可能な人文学の実現にもつながります。
- 本データセットはオープンデータ(CC BY-SA)であり、非商用利用/商用利用を問わず、出典を明示することで無料(フリー)でご利用できます。ご利用にあたっては、各データのライセンスをご確認ください。
AIくずし字認識(くずし字→現代日本語文字変換)
日本古典籍くずし字データセットを活用した、機械学習(ディープラーニング)によるAIくずし字認識サービスを、3種類提供しています。
- AIくずし字認識(一文字)は、くずし字認識ビューア右上のボタンを使って四角を描くと、その中に含まれるくずし字一文字を認識して、現代の日本語文字に変換する機能を提供します。
- KuroNetくずし字認識サービスは、一ページ全体のくずし字をAIで認識する機能を提供します。
- AIくずし字認識アプリ「みを」(Android版/iOS版)は、くずし字を含む画像をスマートフォンで撮影し認識する機能を提供します。
くずし字データセットの特徴
くずし字データベースは、江戸時代の版本(板本)を中心に写本も一部含む古典籍から、ひらがな(変体仮名)・カタカナ・漢字などを切り取って字形を収集しています。ただ、これまでに収集した字形は手書き文字としては比較的読みやすいものが中心で、古文書や古記録など解読がより難しい手書き文字の字形はあまり含まれていません。このような昔の文書の解読にも使えるよう、今後は古文書や古記録などのくずし字(崩し字)の字形もデータベースに加えていきたいと考えています。
このサイトは、様々なくずし字(草書)の用例を目で見て比較するという「くずし字辞典」的な使い方に適しています。もっときちんとくずし字の読み方を勉強したい、練習したいという方には、我々の共同研究者が開発/公開にかかわっているくずし字学習支援アプリKuLAをおすすめします。
くずし字データセットの活用
くずし字データセットは、AIによるくずし字認識を研究開発するための基礎的なデータセットです。詳しくは以下をご覧ください。
日本文化とAIシンポジウム2019〜AIがくずし字を読む時代がやってきた〜
第2回CODHセミナー くずし字チャレンジ 〜機械の認識と人間の翻刻の未来〜
関連サービス
- 印鑑などに使われる篆書(てんしょ)の検索には、篆書字体データベース検索をご利用下さい。
- 古活字画像を用いて現代日本語テキストをくずし字画像に変換するサービスについては、そあん(soan)をご利用下さい。
日本古典籍くずし字データセットは、日本古典籍データセットで公開されるデジタル化された古典籍を中心に、翻刻テキストを制作する過程で生まれるくずし字の座標情報などを、機械のための学習データや人間のための学習データとして提供します。
くずし字データベース検索(ひらがな(変体仮名)・カタカナ・漢字)
データ概要
2019年11月現在、日本古典籍くずし字データセットの規模は、国文学研究資料館所蔵で日本古典籍データセットにて公開する古典籍、および国文学研究資料館の関係機関が公開する古典籍44点の画像データ6,151コマから切り取った、くずし字4,328文字種の字形データ1,086,326文字です。
| 原本補正画像データ | 日本古典籍データセットほかで公開する画像に対して、翻刻作業を容易にするための前処理として、見開き画像を分離するとともに、回転させて正立させるという処理を加えた画像です。 |
| 文字座標データ | 原本補正画像データ上で、文字を取り囲む長方形の座標(XYWH)、文字のUnicodeコードポイント、ブロックID、文字IDを記録したものです。 |
| 字形画像データ | 「原本補正画像データ」に「文字座標データ」を適用して切り抜いた画像であり、文字種ごとに字形を閲覧しやすくするために提供するものです。 |
なおデータセットの仕様については、国文学研究資料館が「くずし字データセット」データ作成基本仕様を公開しています。
このデータセットを引用した論文
ライセンス

『日本古典籍くずし字データセット』(国文学研究資料館ほか所蔵/情報・システム研究機構 データサイエンス共同利用基盤施設 人文学オープンデータ共同利用センター加工)はクリエイティブ・コモンズ 表示 – 継承 4.0 国際 ライセンス(CC BY-SA)の下に提供されています。
データセット全体をご利用の際には、例えば以下のような表示をお願いします。個別の古典籍のみをご利用の場合には、それぞれのページをご覧下さい。
『日本古典籍くずし字データセット』 (国文研ほか所蔵/CODH加工) doi:10.20676/00000340
可能な場合は、データ提供元であるROIS-DS人文学オープンデータ共同利用センターへのリンクをお願いします。
データ提供方法・注意事項
書籍ごとに字形をまとめたZIPファイル、および全部をまとめたZIPファイルを提供します。字形画像データは、全部で数万個のファイルが展開されることがありますので、ご注意下さい。
新字と旧字については、常用漢字の範囲で旧字を新字に統合しました。これは検索などの利便性を考慮した決定です。変換には新旧字体表(常用漢字表)を活用しました。また変体仮名については、変体仮名のUnicodeではなく、変体仮名を統合した現代仮名のUnicodeを用います。
本データセットは翻刻の過程で生み出されたデータです。翻刻とは人間による高精度のテキスト化を意味し、機械による文字認識(OCR)とは異なります。翻刻作業の補助ツールとしてOCRを使うこともありますが、最終的には人間が文字を決定します。この部分は熟練者が作業を進めましたが、それでも読めなかった文字は空白になっているところがあります。またルビについては、現段階では翻刻の対象外です。
本データセットは、主に江戸時代の古典籍に出現した字形を扱っています。しかし、対象とする古典籍のテーマが限られているため、出現する文字種には偏りがあります。今後はより多くのテーマに関する古典籍から字形を集める計画です。さらに前の時代の字形や、古文書に出現する字形などをデータセットに加えていくことも今後の課題です。
バージョンについて
2019年11月11日の更新では、旧字と新字の統合などを中心に、データセットに対する各種のクリーニングを丁寧に行いました。そのためデータセットの内容そのものが非連続的に変化したことから、新しいデータセットをバージョン2、2019年11月11日以前のデータセットをバージョン1と命名することにしました。またこれを機に、データセットZIPファイルのURLもすべて変更しました。
混同を避けるため、現在ダウンロードできるデータはすべてバージョン2に揃えました。ただし過去の研究との連続性を保つため、引き続きバージョン1をダウンロードしたいという方がおられるかもしれません。そのため、バージョン2のダウンロードURLに含まれる「v2」文字列を「v1」に変更すれば、旧データセットをダウンロードできるようにしました。
表記について
くずし字については、「崩し字」「崩し文字」という表記も一部に見受けられますが、学術的な表記は「くずし字」であるため、本サイトもこの表記に統一します。
問い合わせ先
データ・資料に関する問い合わせ窓口 (国文研)
国文学研究資料館
電子メール:htddpsinfo [at] nijl.ac.jp
ウェブサイトに関する問い合わせ窓口 (CODH)
情報・システム研究機構 データサイエンス共同利用基盤施設 人文学オープンデータ共同利用センター
電子メール:kitamoto [at] nii.ac.jp
活用例
くずし字データセットは、手書き文字のデータセットとして文字認識(OCR)の研究開発に利用できます。AIくずし認識などに関する情報は、以下をご覧下さい。
くずし字データセットを用いた機械学習コンペティションについては、以下をご覧下さい。
くずし字データセットから派生した機械学習用データセットについては、以下をご覧下さい。
くずし字データセットに関する研究の進展については、以下をご覧下さい。
日本文化とAIシンポジウム2019〜AIがくずし字を読む時代がやってきた〜
第2回CODHセミナー くずし字チャレンジ 〜機械の認識と人間の翻刻の未来〜
参考文献
KuroNetのページをご覧下さい。
その他の文字データセット
篆書字体データセット – 印鑑などに使われる篆書(てんしょ)の文字データセット
近代雑誌OCR学習用データセット – 明治初期から中期にかけて出版された雑誌(近代雑誌)の文字データセット
ニュース
2022-05-08
データセット全体のダウンロードについて、「字形画像を含む」ファイルと「字形画像を除く」ファイルの2種類を用意しました。またZIPファイルの構成も変更しましたのでご注意下さい。なお機械学習に用いるデータセットの中身には変更ありません。
2020-06-11
Unicode変体仮名一覧を公開しました。 Unicodeに登録されている変体仮名285文字(U+1B002〜U+1B11E)を現代のひらがなごとにまとめ直し、ひらがなごとに字母を確認できるようにしました。
2019-11-11
日本古典籍くずし字データセットに字形データを大幅に追加し、文字数が684,165→1,086,326と100万文字を越えました。またデータセット全体に対してクリーニングを丁寧に行い、その過程で一部の旧字を新字に統合したため、文字種は4,645→4,328に減少しました。
さらに、このデータセットを機械学習に活用したAIくずし字OCRサービスの一つとして、KuroNetくずし字認識サービスも同時に公開しました。
2019-11-05
IIIF Curation Viewer V1.7の新機能を活用したくずし字データセット閲覧ビューアを公開しました。くずし字の翻字を文字マーカーとして表示することで、くずし字と現代の文字を左右に並べて表示し、IIIF画像上で翻刻を読みやすくしました。
2019-03-18
くずし字検索を公開しました。
2019-01-30
日本古典籍くずし字データセットに字形データを追加し、文字種が3,999→4,645、文字数が403,242→684,165(約1.7倍)に増えました。数点の料理本に加え、言葉遊び本『ぢぐち』や、人情本の代表作『春色梅児誉美』、人気滑稽本『浮世風呂』などを含みます。
2018-11-17
日本古典籍くずし字データセット / Kuzushiji Dataset(旧名:日本古典籍字形データセット / Dataset of PMJT Character Shapes)にdoi:10.20676/00000340を付与しました。
2017-10-13
日本古典籍字形データセットで、データがダウンロードできなくなっていた問題を修正しました。
2017-06-06
養蚕秘録 日本古典籍字形データセットにファイル名の誤りが存在しましたので修正しました。なおデータの中身には変更ありません。
2017-06-02
日本古典籍字形データセットにくずし字データを追加し、文字種が1,521→3,999、文字数が86,176→403,242に増えました。またライセンスはCC BY-SA 4.0で変更ありませんが、表示すべき情報が変わりましたのでご確認下さい。
2017-03-20
第21回 PRMUアルゴリズムコンテスト この文字読めますか? 〜くずし字認識にチャレンジ!〜の告知が始まりました。CODHは日本古典籍字形データセットを提供し、コンテストの企画にも関わります。
2016-11-17
日本古典籍字形データセットを公開しました(ニュース)。
数据统计
数据评估
关于日本古典籍くずし字検索特别声明
本站安逸导航提供的日本古典籍くずし字検索都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由安逸导航实际控制,在08/12/2026 08:48收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,安逸导航不承担任何责任。
相关导航
『漢字データベースプロジェクト』は、Unicode / UCS (Universal Multiple-Octet Coded Character Sets) によって符号化された漢字(CJK統合漢字)の情報交換・検索照合・分析に役立つ様々なデータベースを整備することを目的に、2003年度に日本学術振興会科学研究費補助金・研究成果公開促進費(データベース)の援助を受けて開始しました。
梅花书检
梅花书检可在线查询历代书法家作品,内容包括草书、行书、楷书、篆书、隶书、篆刻等海量书法资料,在传统查询之外还增加部首查询功能,精准锁定书法家,书法出处进行查询。新增通假字链接,让查询更专业更便捷。字体反转功能可帮助篆刻者学习并提升水平。梅花书检是最懂书法篆刻者的字典。
漢語多功能字庫
《漢語多功能字庫》加強版, 除於「形義通解」部份增補了和修繕了大量詞條外,還把原有的功能重新組織,並新增了「其他方言讀音」、《說文解字》全文索引、 《讀史方輿紀要》,和「成語彙輯」等新功能。本中心的運作宗旨始終如一,就是竭盡所能,為未來的漢語漢字教育從事「基礎建設」工作。
清代職官資料庫
明清檔案工作室自1996年起承命開始將典藏之檔案進行數位化工作,就個別文件建立詳細「後設資料」以提供檔案描述及檢索途徑,並運用技術,以數位掃描方式,儲存檔案圖像。
国文学研究資料館
国文学研究資料館は、国内各地の日本文学とその関連資料を大規模に集積し、日本文学をはじめとする様々な分野の研究者の利用に供するとともに、それらに基づく先進的な共同研究を推進する日本文学の基盤的な総合研究機関です。
明清內閣大庫檔案
明清檔案工作室自1996年起承命開始將典藏之檔案進行數位化工作,就個別文件建立詳細「後設資料」以提供檔案描述及檢索途徑,並運用技術,以數位掃描方式,儲存檔案圖像。
明清人物傳記資料庫
明清檔案工作室自1996年起承命開始將典藏之檔案進行數位化工作,就個別文件建立詳細「後設資料」以提供檔案描述及檢索途徑,並運用技術,以數位掃描方式,儲存檔案圖像。
簡牘字典 | 史語所藏居延漢簡資料庫
簡牘字典 | 史語所藏居延漢簡資料庫
暂无评论...


