🔮結論:推奨されるフィルタリング条件

  1. 著者除外: Nonaka, Takeuchi を除外。
  2. キーワード除外: SECI, Ba, knowledge management を除外。
  3. キーワード必須: subsidiary awareness と focal awareness が両方含まれる文献を優先。
  4. 言語除外: 日本語文献を除外(language: en)。
  5. 原典優先: Polanyi, M. (1966) The Tacit Dimension をベースラインとし、それを厳密に引用する哲学者・認知科学者の文献を残す。

Q:わたしの望むコーパス指定のプロンプト作成してください^_^

A:ご要望の

コーパス(「大学教授の高引用論文」かつ「ポランニーの厳密な定義」を含むもの)を構築するための、検索用プロンプト(クエリ)を作成。

用途に合わせて使い分け、

Semantic Scholar API や OpenAlex API、および一般的な学術データベース向けに最適化。


1. Semantic Scholar API 用プロンプト

Semantic Scholarは、fields パラメータで取得する項目を細かく指定でき、minCitationCount で高引用論文を絞り込む。

検索クエリ (Query):

text


"Michael Polanyi" AND "subsidiary awareness" AND "focal awareness" AND "indwelling"

API リクエスト例 (Python requestsライブラリ風):

python


params = {

    "query": '"Michael Polanyi" AND "subsidiary awareness" AND "focal awareness" AND "indwelling"',

    "limit": 100,

    "fields": "title,year,citationCount,authors,abstract,tldr", # tldrはAI要約

    "minCitationCount": 100, # 被引用回数100回以上

    "sort": "citationCount:desc",

    "year": None # 年代指定は任意

}

フィルタリング補足 (Post-processing):
取得した結果から、以下の著者を除外するロジックを必ず入れる。

・Exclude Authors: Nonaka, Takeuchi, Davenport, Prusak


2. OpenAlex API 用プロンプト

OpenAlexは、著者の所属機関(大学)、特定用語出現を精密にフィルタリング。

検索クエリ (Query):

text


search=Michael+Polanyi+subsidiary+awareness+focal+awareness+indwelling&filter=citation_count:>100,institutions.primary_location.institution.type:university

詳細なフィルタリング (Filter):

text


filter=

  citation_count:>100,

  institutions.primary_location.institution.type:university,

  search:Michael+Polanyi+subsidiary+awareness+focal+awareness,

  exclude_author_ids:AA505747681,AA504363642 # Nonaka & TakeuchiのOpenAlex ID(事前に確認が必要)

※ exclude_author_ids は、野中郁次郎氏と竹内弘高氏のOpenAlex IDを指定することで、直接的に除外。


3. 一般的な学術データベース (Web of Science / Scopus) 用プロンプト

タイトル、要約、キーワードでの検索。

検索式 (Search String):

text


TS=("Michael Polanyi" AND "subsidiary awareness" AND "focal awareness" AND "indwelling")

AND

PY >= 1966

AND

Citations >= 100

除外条件 (Exclude):

・Author: Nonaka, Ikujiro; Takeuchi, Hirotaka

・Keywords: SECI; Ba; Knowledge Management (文脈によっては除外)


4. 最終的なフィルタリング・チェックリスト (Pythonロジック用)

APIで取得したメタデータに対して、以下の条件でフィルタリング(除外/残す)を実行。

python


def is_valid_polanyi_paper(paper):

    # 1. 著者のチェック

    authors = [author.lower() for author in paper.get("authors", [])]

    if any("nonaka" in a or "takeuchi" in a for a in authors):

        return False

    

    # 2. 本文/要約のチェック (汚染データの除外)

    text = (paper.get("title", "") + " " + paper.get("abstract", "")).lower()

    

    # 除外キーワード (野中流のビジネス用語)

    exclude_terms = ["seci", "ba", "knowledge management", "socialization", "externalization"]

    if any(term in text for term in exclude_terms):

        return False

        

    # 必須キーワード (ポランニーの厳密な定義)

    include_terms = ["subsidiary awareness", "focal awareness", "indwelling", "proximal", "distal"]

    if not all(term in text for term in include_terms):

        return False

        

    # 3. 引用回数のチェック

    if paper.get("citationCount", 0) < 100:

        return False

        

    return True


推奨される次のステップ

①Semantic Scholar API で上記クエリを実行し、結果を取得。

②上記の Pythonロジック で著者名とキーワードをフィルタリング。

③残った論文の Abstract または PDF をダウンロードし、proximal term と external term が文脈として正しいか(ポランニーの原典通りか)を最終確認。

このプロンプトとロジックを使用で、「野中流の汚染データ」を排除し、「大学教授の高引用論文」かつ「ポランニーの厳密な定義」を含むコーパスを構築。


後記、

参照論文は、引用回数が10回以上ではデータが皆無ならば、4回以上引用の原文のみで他のデータは無視。