跳转到主内容

聊天與文件

資訊處理的下一步

與其依賴公開數據集和一般知識相比,“與文件聊天”會根據你可信的內部資源生成特定語境的回答與分析。上傳你的文件,並使用這些文件作為聊天中回答問題的基礎!

解決數據限制

當你向語言模型提出問題時,你依賴於模型訓練時所使用的數據集。通常這是從網際網路取得的資訊。不公開來源很可能不包含在該數據集中。將你的文件作為聊天的來源,你可以確保模型具備回答你問題所需的資訊。

與你的文件相關的能力

你可以對你的文件提出問題,例如列出文件的要點或對文件進行摘要。也可以讓語言模型根據你的自己的數據集執行特定分析。

文件為基礎的聊天的缺點

上傳文件並對其進行處理需要額外的步驟,若你在沒有特定資訊背景的情況下也能得到不依賴上下文的良好回答,則無需這些步驟。此外,因為必須先從文件中取出所需資訊再送出請求給語言模型,生成回答的時間也較長。

揭開文件聊天的背後

你上傳的文件中的文字會被從文件中提取,並切分成區塊。這些區塊有固定的字數(1024 個字),我們也設定了區塊之間的重疊(128 個字)。每段文字會被存儲為向量於向量資料庫中。每次提問時,根據與所問內容的相似性從這些資料中選出相關內容。

文件片段的選擇過程

這些文字片段已經轉換為向量。向量具有多個維度,表示這段文字與其他文字的“相似程度”。就像 RGB 顏色系統一樣,具有相似的 RGB 值的顏色較為相近。向量資料庫因此能讓我們依據問題將片段有序、過濾地取出。我們最多選取 100 段 1024 字的文字與問題一起送出。

適合文件為基礎的聊天的模型

我們已選擇具有較大上下文視窗的模型,以便能夠與文件聊天。希望最多能同時送出 100 段、1024 字的內容。這超過 100,000 字。建議優先使用中央模型目錄中的高品質語言模型。

適合的模型

適合的模型具備足夠的上下文容量與良好的文件分析能力,例如 OpenAI、Claude、Google 的高品質模型,或歐洲的 AI 模型。

選擇一個或多個文件

你可以通過在問題欄右側點擊回形針圖示開啟檔案上傳模式。最多可選擇 10 個檔案進行聊天。

適合的語言模型

當你開始與文件聊天時,系統會檢查該語言模型是否適合用於文件聊天。如果不符合,將自動從當前目錄中選擇一個適合的模型。

在開啟檔案模式時,你就可以與這些文件聊天。

單檔處理

除了文件聊天外,AI-Corporate 也提供對每個檔案單獨套用提示並得到個別回覆的功能。此功能稱為「逐檔處理」。

逐檔處理

此功能可與「與檔案聊天」結合使用。

可能的場景

使用「逐檔處理」的實用範例:

  1. 你上傳參考檔案(例如合同樣本),並在「與檔案聊天」中打開它
  2. 上傳多個需要分析的檔案,並開啟「逐檔處理」
  3. 你提出一個會套用於所有檔案的提示,逐一套用於各檔案

透過這種方式,你可以讓所有合約自動根據參考樣本進行分析。

最大檔案數量

「逐檔處理」功能有 30 檔的上限。

支援的檔案類型

AI-Corporate 支援多種檔案類型以進行文件聊天:

  • .pdf 的 PDF 檔
  • .docx 的 Word 檔
  • .csv 的 CSV 檔
  • .json 的 JSON 檔
  • .txt 的純文字檔
  • 擴展名為 'mp3', 'mp4', 'mpeg', 'mpga', 'm4a', 'wav' 或 'webm' 的音訊與視訊檔

与音频或视频文件聊天

AI-School 会先用设置好的转录提供商把音频和视频文件转为文本。对于对话,结果可能包含时间块和说话人标签。之后可以用合适的文本模型修正标点、拼写、说话人标签和专业术语。由于提供商和模型限制,长文件的处理方式可能不同于短文件。

WhatsApp