光数(東京都港区)は2026年8月31日、日本語文書検索に特化した次世代の小型AIモデルの研究開発を始めた。特許・技術・行政・法務などの専門文書を対象に、高精度かつ高速な検索と理解を狙い、CPU環境でも使える軽量構成を目標に据える。
同社は検索→Rerankerの二段階処理に頼らず、検索モデル自体の意味理解と関連性判定を高めて「直接検索」での精度確保を目指す。日本語中心データで小型モデルをゼロから事前学習し、領域別に追加学習できる設計とする方針です。
背景には、2025年度にNEDOのプログラム「GENIAC-PRIZE」領域02へ参加し、特許審査業務をモデルケースにプロトタイプを開発した経験がある。PoCではRerankerの処理負荷が課題となり、文書単位の類似度だけでは長文の重要論点抽出や複数文書の共通点・相違点把握が不十分だと分かったという。研究テーマは「3点」として整理している。
今後は特許文書などで学習・評価を進め、多言語EmbeddingモデルやEmbedding+Reranker構成と比較検証し、日本語専門文書の検索・分析基盤の研究開発を進める。なお同社は2024年10月設立で、資本金は300万円です。
【関連リンク】
公式HP:https://ai.wdx.jp
お問い合わせ:ai@wdx.jp
AI生成記事のため誤りを含む場合があります
PRTIMES
PRTIMES
日本語文書検索に特化した次世代小型AIモデルの研究開発を開始







