日本古典籍くずし字検索

11小时前发布 5 0 0

日本古典文本Kuzushiji数据集提供Kuzushiji字符的坐标信息,这些字符是在创建转录文本的过程中生成的,主要来自日本古典文本数据集中发布的数字化古典文本,作为机器和人类的训练数据。

所在地:
日本
收录时间:
2026-08-12
日本古典籍くずし字検索日本古典籍くずし字検索

くずし字検索

文字またはUnicode(U+????)を入力: 

検索結果:

 

日本古典籍くずし字データセットを文字または文字コードで検索し、ひらがな(変体仮名)・カタカナ・漢字の字形を表示します。2019年11月現在、古典籍44点の画像データ6,151コマから切り取った、くずし字4,328文字種の字形データ1,086,326文字が検索対象です。それぞれの文字の出現頻度については文字種ごとのくずし字一覧、変体仮名についてはUnicode変体仮名一覧をご覧下さい。

サイトの使い方

  1. 検索ボックスに文字列を入力します。一文字の場合は、文字コード(Unicode)ごとの字形一覧ページに直接移動します。また複数文字の場合は、文字コードごとのページへのリンクを表示します。
  2. 字形一覧ページの個々の文字をクリックすると、くずし字認識ビューア上に原本のデジタル画像を表示するとともに、文字の位置(四角形)を青線で表示します。これはくずし字の用例、すなわちどのような文脈で出現した文字かを確認できるだけでなく、文字が連続する続け字(連綿)の書き方の見本としても便利です。
  3. このように、データの根拠となる原本へのリンクを提示し、IIIFを活用したアプリで表示できるのがデジタルアーカイブの強みです。これは検証可能な人文学の実現にもつながります。
  4. 本データセットはオープンデータ(CC BY-SA)であり、非商用利用/商用利用を問わず、出典を明示することで無料(フリー)でご利用できます。ご利用にあたっては、各データのライセンスをご確認ください。

AIくずし字認識(くずし字→現代日本語文字変換)

日本古典籍くずし字データセットを活用した、機械学習(ディープラーニング)によるAIくずし字認識サービスを、3種類提供しています。

  1. AIくずし字認識(一文字)は、くずし字認識ビューア右上のボタンを使って四角を描くと、その中に含まれるくずし字一文字を認識して、現代の日本語文字に変換する機能を提供します。
  2. KuroNetくずし字認識サービスは、一ページ全体のくずし字をAIで認識する機能を提供します。
  3. AIくずし字認識アプリ「みを」(Android版/iOS版)は、くずし字を含む画像をスマートフォンで撮影し認識する機能を提供します。

くずし字アプリ・サービス(検索/認識/解析/解読)

くずし字データセットの特徴

くずし字データベースは、江戸時代の版本(板本)を中心に写本も一部含む古典籍から、ひらがな(変体仮名)・カタカナ・漢字などを切り取って字形を収集しています。ただ、これまでに収集した字形は手書き文字としては比較的読みやすいものが中心で、古文書や古記録など解読がより難しい手書き文字の字形はあまり含まれていません。このような昔の文書の解読にも使えるよう、今後は古文書や古記録などのくずし字(崩し字)の字形もデータベースに加えていきたいと考えています。

Unicode変体仮名一覧

くずし字とは?

このサイトは、様々なくずし字(草書)の用例を目で見て比較するという「くずし字辞典」的な使い方に適しています。もっときちんとくずし字の読み方を勉強したい、練習したいという方には、我々の共同研究者が開発/公開にかかわっているくずし字学習支援アプリKuLAをおすすめします。

くずし字データセットの活用

くずし字データセットは、AIによるくずし字認識を研究開発するための基礎的なデータセットです。詳しくは以下をご覧ください。

くずし字チャレンジ!

くずし字翻刻(テキスト化)/古文・漢文→現代文翻訳

くずし字OCR(AIくずし字認識)

日本文化とAIシンポジウム2019〜AIがくずし字を読む時代がやってきた〜

第2回CODHセミナー くずし字チャレンジ 〜機械の認識と人間の翻刻の未来〜

関連サービス

  1. 印鑑などに使われる篆書(てんしょ)の検索には、篆書字体データベース検索をご利用下さい。
  2. 古活字画像を用いて現代日本語テキストをくずし字画像に変換するサービスについては、そあん(soan)をご利用下さい。

 

日本古典籍くずし字データセットは、日本古典籍データセットで公開されるデジタル化された古典籍を中心に、翻刻テキストを制作する過程で生まれるくずし字の座標情報などを、機械のための学習データや人間のための学習データとして提供します。

くずし字データベース検索(ひらがな(変体仮名)・カタカナ・漢字)

くずし字データセットの一覧を見る(機械のための学習データ)

文字種ごとのくずし字一覧を見る(人間のための学習データ)

データ概要

2019年11月現在、日本古典籍くずし字データセットの規模は、国文学研究資料館所蔵で日本古典籍データセットにて公開する古典籍、および国文学研究資料館の関係機関が公開する古典籍44点の画像データ6,151コマから切り取った、くずし字4,328文字種の字形データ1,086,326文字です。

原本補正画像データ 日本古典籍データセットほかで公開する画像に対して、翻刻作業を容易にするための前処理として、見開き画像を分離するとともに、回転させて正立させるという処理を加えた画像です。
文字座標データ 原本補正画像データ上で、文字を取り囲む長方形の座標(XYWH)、文字のUnicodeコードポイント、ブロックID、文字IDを記録したものです。
字形画像データ 「原本補正画像データ」に「文字座標データ」を適用して切り抜いた画像であり、文字種ごとに字形を閲覧しやすくするために提供するものです。

なおデータセットの仕様については、国文学研究資料館が「くずし字データセット」データ作成基本仕様を公開しています。

このデータセットを引用した論文

ライセンス

クリエイティブ・コモンズ・ライセンス
『日本古典籍くずし字データセット』(国文学研究資料館ほか所蔵/情報・システム研究機構 データサイエンス共同利用基盤施設 人文学オープンデータ共同利用センター加工)はクリエイティブ・コモンズ 表示 – 継承 4.0 国際 ライセンス(CC BY-SA)の下に提供されています。

データセット全体をご利用の際には、例えば以下のような表示をお願いします。個別の古典籍のみをご利用の場合には、それぞれのページをご覧下さい。

『日本古典籍くずし字データセット』 (国文研ほか所蔵/CODH加工) doi:10.20676/00000340

可能な場合は、データ提供元であるROIS-DS人文学オープンデータ共同利用センターへのリンクをお願いします。

提供:ROIS-DS人文学オープンデータ共同利用センター

データ提供方法・注意事項

書籍ごとに字形をまとめたZIPファイル、および全部をまとめたZIPファイルを提供します。字形画像データは、全部で数万個のファイルが展開されることがありますので、ご注意下さい。

新字と旧字については、常用漢字の範囲で旧字を新字に統合しました。これは検索などの利便性を考慮した決定です。変換には新旧字体表(常用漢字表)を活用しました。また変体仮名については、変体仮名のUnicodeではなく、変体仮名を統合した現代仮名のUnicodeを用います。

本データセットは翻刻の過程で生み出されたデータです。翻刻とは人間による高精度のテキスト化を意味し、機械による文字認識(OCR)とは異なります。翻刻作業の補助ツールとしてOCRを使うこともありますが、最終的には人間が文字を決定します。この部分は熟練者が作業を進めましたが、それでも読めなかった文字は空白になっているところがあります。またルビについては、現段階では翻刻の対象外です。

本データセットは、主に江戸時代の古典籍に出現した字形を扱っています。しかし、対象とする古典籍のテーマが限られているため、出現する文字種には偏りがあります。今後はより多くのテーマに関する古典籍から字形を集める計画です。さらに前の時代の字形や、古文書に出現する字形などをデータセットに加えていくことも今後の課題です。

バージョンについて

2019年11月11日の更新では、旧字と新字の統合などを中心に、データセットに対する各種のクリーニングを丁寧に行いました。そのためデータセットの内容そのものが非連続的に変化したことから、新しいデータセットをバージョン2、2019年11月11日以前のデータセットをバージョン1と命名することにしました。またこれを機に、データセットZIPファイルのURLもすべて変更しました。

混同を避けるため、現在ダウンロードできるデータはすべてバージョン2に揃えました。ただし過去の研究との連続性を保つため、引き続きバージョン1をダウンロードしたいという方がおられるかもしれません。そのため、バージョン2のダウンロードURLに含まれる「v2」文字列を「v1」に変更すれば、旧データセットをダウンロードできるようにしました。

表記について

くずし字については、「崩し字」「崩し文字」という表記も一部に見受けられますが、学術的な表記は「くずし字」であるため、本サイトもこの表記に統一します。

問い合わせ先

データ・資料に関する問い合わせ窓口 (国文研)

国文学研究資料館
電子メール:htddpsinfo [at] nijl.ac.jp

ウェブサイトに関する問い合わせ窓口 (CODH)

情報・システム研究機構 データサイエンス共同利用基盤施設 人文学オープンデータ共同利用センター
電子メール:kitamoto [at] nii.ac.jp

活用例

くずし字データセットは、手書き文字のデータセットとして文字認識(OCR)の研究開発に利用できます。AIくずし認識などに関する情報は、以下をご覧下さい。

KuroNetくずし字認識サービス

くずし字OCRサービス

くずし字OCR(AIくずし字認識)について

くずし字翻刻(テキスト化)/古文・漢文→現代文翻訳

くずし字アプリ・サービス(検索/認識/解析/解読)

くずし字データセットを用いた機械学習コンペティションについては、以下をご覧下さい。

Kaggleコンペティション:くずし字認識

くずし字データセットから派生した機械学習用データセットについては、以下をご覧下さい。

KMNISTデータセット(機械学習用くずし字データセット)

くずし字データセットに関する研究の進展については、以下をご覧下さい。

くずし字チャレンジ!

日本文化とAIシンポジウム2019〜AIがくずし字を読む時代がやってきた〜

第2回CODHセミナー くずし字チャレンジ 〜機械の認識と人間の翻刻の未来〜

参考文献

KuroNetのページをご覧下さい。

その他の文字データセット

篆書字体データセット – 印鑑などに使われる篆書(てんしょ)の文字データセット

近代雑誌OCR学習用データセット – 明治初期から中期にかけて出版された雑誌(近代雑誌)の文字データセット

ニュース

2022-05-08

データセット全体のダウンロードについて、「字形画像を含む」ファイルと「字形画像を除く」ファイルの2種類を用意しました。またZIPファイルの構成も変更しましたのでご注意下さい。なお機械学習に用いるデータセットの中身には変更ありません。

2020-06-11

Unicode変体仮名一覧を公開しました。 Unicodeに登録されている変体仮名285文字(U+1B002〜U+1B11E)を現代のひらがなごとにまとめ直し、ひらがなごとに字母を確認できるようにしました。

2019-11-11

日本古典籍くずし字データセットに字形データを大幅に追加し、文字数が684,165→1,086,326と100万文字を越えました。またデータセット全体に対してクリーニングを丁寧に行い、その過程で一部の旧字を新字に統合したため、文字種は4,645→4,328に減少しました。

さらに、このデータセットを機械学習に活用したAIくずし字OCRサービスの一つとして、KuroNetくずし字認識サービスも同時に公開しました。

2019-11-05

IIIF Curation Viewer V1.7の新機能を活用したくずし字データセット閲覧ビューアを公開しました。くずし字の翻字を文字マーカーとして表示することで、くずし字と現代の文字を左右に並べて表示し、IIIF画像上で翻刻を読みやすくしました。

2019-03-18

くずし字検索を公開しました。

2019-01-30

日本古典籍くずし字データセットに字形データを追加し、文字種が3,999→4,645、文字数が403,242→684,165(約1.7倍)に増えました。数点の料理本に加え、言葉遊び本『ぢぐち』や、人情本の代表作『春色梅児誉美』、人気滑稽本『浮世風呂』などを含みます。

2018-11-17

日本古典籍くずし字データセット / Kuzushiji Dataset(旧名:日本古典籍字形データセット / Dataset of PMJT Character Shapes)にdoi:10.20676/00000340を付与しました。

2017-10-13

日本古典籍字形データセットで、データがダウンロードできなくなっていた問題を修正しました。

2017-06-06

養蚕秘録 日本古典籍字形データセットにファイル名の誤りが存在しましたので修正しました。なおデータの中身には変更ありません。

2017-06-02

日本古典籍字形データセットにくずし字データを追加し、文字種が1,521→3,999、文字数が86,176→403,242に増えました。またライセンスはCC BY-SA 4.0で変更ありませんが、表示すべき情報が変わりましたのでご確認下さい。

2017-03-20

第21回 PRMUアルゴリズムコンテスト この文字読めますか? 〜くずし字認識にチャレンジ!〜の告知が始まりました。CODHは日本古典籍字形データセットを提供し、コンテストの企画にも関わります。

2016-11-17

日本古典籍字形データセットを公開しました(ニュース)。

数据统计

数据评估

日本古典籍くずし字検索浏览人数已经达到5,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:日本古典籍くずし字検索的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找日本古典籍くずし字検索的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于日本古典籍くずし字検索特别声明

本站安逸导航提供的日本古典籍くずし字検索都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由安逸导航实际控制,在08/12/2026 08:48收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,安逸导航不承担任何责任。

相关导航

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...